Hacker News Digest

Тег: #wayback-machine

Постов: 5

Keep Our Servers Running (blog.archive.org) 🔥 Горячее 💬 Длинная дискуссия

В сентябре Internet Archive запускает акцию: при оформлении регулярного пожертвования от $25 в месяц ваш первый взнос будет удвоен благодаря грантовому совпадению 2:1. Это означает, что $25 в месяц превращаются в $75 поддержки, $50 — в $150, а $100 — в $300. Такие регулярные пожертвования критически важны, так как в среднем именно они составляют основу финансирования архива.

Архив хранит 210 петабайт знаний — от сканированных книг до снимков веб-страниц в Wayback Machine — и остаётся полностью бесплатным, без рекламы, продажи данных или outsourcing ключевых технологий. Его независимая инфраструктура требует постоянных инвестиций в серверы, хранение, энергию и команду инженеров. Поддерживая архив регулярным пожертвованием, вы напрямую способствуете сохранению доступа к человеческому знанию для нынешнего и будущих поколений.

by sonicrocketman • 07 сентября 2026 г. в 03:29 • 858 points

ОригиналHN

#internet-archive#servers#storage#wayback-machine

Комментарии (213)

В thread обсуждаются предложения 2:1 для IA: такие матчинговые схемы считаются стандартной практикой среди крупных благотворительных организаций, хотя часть комментаторов сомневается в их честности; другие отмечают, что они эмпирически привлекают больше мелких доноров и усиливают их ощущение вклада. При оплате через Google Pay подписка активируется по умолчанию, а отмена возможна только через поддержку, что делает процесс рискованным. IA зарегистрирована как американская некоммерческая организация (501(c)(3)), поэтому доноры из ЕС не получают налоговых чеков от местных фондов; для них рекомендуется SEPA‐перевод на указанный британский счёт (GB74RBOS16107510000470) — это быстрее и дешевле wire‐transfer. Пользователи жалуются на технические ограничения IA (частые 429‐ошибки и тайм‐ауты); предложение ввести отдельный донорский уровень для их обхода может конфликтовать со статусом 501(c)(3). Некоторые считают archive.today надёжнее, так как IA чаще блокирует сайты. В качестве альтернативных моделей финансирования предлагается привлекать спонсоров — крупные хостинг‐провайдеры или компании, занимающиеся ИИ‐скрапингом. Идея полностью волонтёрского обслуживания по модели Red Cross Code4Good считается нереалистичной: инфраструктура требует круглосуточной профессиональной поддержки. Остаётся открытым вопрос о законности и моральной оправданности копирования защищённого контента: одни считают это нарушением прав авторов, другие указывают на общественную ценность доступа к информации.

Three sites made 215,128 “best software” pages for AI. Perplexity cites them (trellner.com) 🔥 Горячее 💬 Длинная дискуссия

Исследование показало, что две модели Perplexity при поиске «лучшего» ПО в 380 категориях часто ссылаются на низкокачественные источники. Из 7534 цитат 59,8% ведут на домены хуже 100 000-го места в Tranco, а 23,4% — вовсе вне топ-миллиона. Медианный Tranco-ранг цитируемых доменов — 71 611, а 36,5% из 2055 уникальных доменов не попадают в топ-миллион вообще. Эти домены значительно новее: медианный первый снимок в Wayback Machine — 2020 год против 2011 у популярных источников, и 16,6% из них впервые архивированы в 2025 году или позже.

Треть по частоте цитирования занимает блог Guideflow.com — продавца интерактивных демо, а не площадки с обзорами. Его блог был упомянут 194 раза в 96 категориях (по одной статье на категорию), опередив Gartner. Все три домена, генерирующих машинные «лучшие» списки («Best List» сайтов), появились после декабря 2023 года и, вероятно, находятся под общим управлением из-за одинакового шаблона и инфраструктуры. Они создали 215 128 страниц вида «best <category>». Несмотря на это, исследование не оценивало, влияют ли такие источники на качество рекомендаций — только документировало, из чего состоит доказательная база моделей. Wikipedia, для сравнения, была цитирована всего три раза. Полные данные и код доступны на сайте автора.

by jakobgreenfeld • 02 сентября 2026 г. в 13:59 • 436 points

ОригиналHN

#gartner#guideflow.com#llm#perplexity#tranco#wayback-machine#wikipedia

Комментарии (213)

Обсуждение выявило несколько ключевых проблем LLM-поиска: - Модели цитируют низкокачественные источники и генерируют ложные факты на основе единичных соцсетевых упоминаний, формируя цикл дезинформации. - LLM предпочитают собственные тексты из-за совпадения с обучающими паттернами, даже когда они хуже человеческих. - Модели не оценивают качество источников, принимая за истину даже Reddit-комментарии с опечатками. - SEO-фирмы генерируют контент с минимальным KL-расхождением от ответов моделей; сегмент «best software» — самый спамный, с сайтами, созданными исключительно для цитирования LLM. - Perplexity и другие LLM-поисковики жертвуют качеством ради скорости: ссылки не соответствуют тексту. - Модели ассоциируют определённые фразы («load-bearing», «crucial») с качеством, позволяя искусственно улучшать тексты без изменения смысла. - LLM не различают авторство и оценивают текст по стилистическим шаблонам, а не по реальной эффективности. - В нишевых SaaS пользователи отмечают, что LLM рекомендуют фиктивные «лучшие» решения вместо реальных инструментов. - Практика «AI SEO» — массовая генерация страниц «best X» на несуществующих доменах, идеальных для цитирования. - Многие пользователи возвращаются к вручную отобранным источникам (Wikipedia, arXiv, Reddit), считая открытый веб непригодным для достоверного поиска. - Замкнутый круг: AI генерирует сайты → LLM их цитирует → сайты попадают в обучающие данные → AI генерирует ещё больше. - AI-статьи стали шаблонными и пустыми, что снижает доверие к выдаче моделей. - Модели не различают рекламу, аффилированный и независимый контент. - AI-поиск, по мнению части пользователей, уничтожил возможность находить новые решения — результаты сводятся к рерайту популярных шаблонов. - Спор: один пользователь утверждает, что OpenAI поддерживает исключение доменов, но другие отмечают, что инструменты поиска Anthropic и OpenAI пока не позволяют эффективно фильтровать шум.

FBI tries to unmask owner of archive.is (heise.de) 🔥 Горячее 💬 Длинная дискуссия

FBI потребовала от провайдера Tucows предоставить данные пользователей Archive.today — одного из самых загадочных и известных интернет-ресурсов. Сервис, работающий более десяти лет, позволяет сохранять и просматривать предыдущие версии веб-страниц, подобно Wayback Machine, но с минимальными ограничениями. Судебный ордер обязал компанию передать информацию о пользователях, что вызвало обеспокоенность в сообществе.

Archive.today привлекает внимание из-за своей политики минимального вмешательства в контент, что делает его популярным инструментом для сохранения информации. Сервис активно используется журналистами, исследователями и активистами для архивации материалов, которые могут быть удалены или изменены. Требование спецслужб ставит под вопрос конфиденциальность пользователей и принципы работы подобных платформ.

by Projectiboga • 06 ноября 2025 г. в 16:18 • 884 points

ОригиналHN

#archive.today#fbi#tor#tucows#wayback-machine

Комментарии (444)

  • FBI расследует archive.today как часть уголовного дела, хотя неясно, какое именно преступление подразумевается.
  • Сайт используется для обхода платных стен, что делает его целью для издателей, которые не могут предложить удобный UX.
  • Появляются сообщения, что оператор может быть в России, что вызывает вопросы о том, почему ФБР не может просто заблокировать сайт, если бы это было правдой.
  • Пользователи HN обсуждают, что если бы archive.today исчезнет, это лишит их возможности делиться ссылками на статьи без paywall, что вызывает тревогу.
  • Некоторые комментаторы подчеркивают, что archive.today использует ботнет и Tor для обхода блокировок, что может быть причиной, по которой ФБР считает его угрозой.

1 Trillion Web Pages Archived (blog.archive.org) 🔥 Горячее

Интернет-архив достигнет триллиона сохранённых веб-страниц в Wayback Machine в октябре — это результат почти 30 лет работы с библиотеками по всему миру для создания коллективной цифровой памяти человечества. Масштаб достижения подчёркивает важность сохранения онлайн-истории: от глобальных новостей до личных страниц, которые иначе были бы утрачены.

В честь события запланирована серия мероприятий, включая концерт Del Sol Quartet, диалог Тима Бернерса-Ли и Брюстера Кейла о будущем интернета, виртуальный форум библиотечных лидеров и экскурсии по физическому архиву. Эти события не только отмечают веху, но и подчёркивают необходимость продолжать совместными усилиями сохранять веб-контент для будущих поколений.

by pabs3 • 06 октября 2025 г. в 03:48 • 579 points

ОригиналHN

#archive.is#common-crawl#internet-archive#ipfs#pywaybackup#torrent#wayback-machine

Комментарии (81)

  • Пользователи предлагают технические улучшения для Internet Archive: распределенное пиринговое зеркалирование (по типу torrent), интеграция с IPFS, улучшение поиска по содержимому страниц и статистики.
  • Обсуждаются вопросы масштаба и инфраструктуры архива: объем данных, надежность хранения, защита от несанкционированного изменения, сотрудничество с Common Crawl и ArchiveTeam.
  • Высказывается критика в адрес скорости работы сервиса, сложности извлечения данных и точности метрик, а также опасения о приватности из-за отсутствия возможности удалить информацию.
  • Пользователи делятся инструментами для работы с архивом (например, pywaybackup) и альтернативными сервисами (archive.is).
  • Участники выражают благодарность и поддержку Internet Archive, интересуются мероприятиями организации и возможностями трудоустройства.

ArchiveTeam has finished archiving all goo.gl short links (tracker.archiveteam.org) 🔥 Горячее

Как запустить ArchiveTeam Warrior

Это виртуальная машина для архивации сайтов. Работает на Windows, macOS, Linux через VirtualBox или VMware, не влияет на систему, использует лишь трафик и немного диска.

Быстрый старт (VirtualBox)

  1. Скачайте образ (357 МБ).
  2. VirtualBox → Файл → Импортировать → выбрать файл.
  3. Запустите ВМ; она обновится и предложит открыть браузер.

После запуска

  • Откройте http://localhost:8001/
  • Укажите имя для таблицы лидеров.
  • Выберите проект во вкладке «All projects» или оставьте «ArchiveTeam’s Choice» для автоматического выбора приоритетной задачи.

Goo-gl tracker
Загрузка…

by pentagrama • 17 августа 2025 г. в 17:46 • 384 points

ОригиналHN

#archiveteam#data-preservation#docker#goo.gl#url#virtualbox#vmware#wayback-machine#web-archiving

Комментарии (90)

  • ArchiveTeam (не Archive.org) спас 3,75 млрд коротких ссылок goo.gl и весь их контент (91 ТиБ) до отключения Google 25 августа.
  • Данные уже поступают в Wayback Machine; сами файлы WARC пока закрыты «access-restricted».
  • Участники просто запускали Docker-контейнер, перебирая пространство URL, чтобы не попасть под бан.
  • Поднимались идеи блокчейн/P2P-краулера и сравнение с CommonCrawl, но основная цель — предотвратить link rot.
  • Reddit и Twitter тоже архивировались (Pushshift, ArcticShift, AcademicTorrents), пока API не закрыли.