Keep Our Servers Running 🔥 Горячее 💬 Длинная дискуссия
В сентябре Internet Archive запускает акцию: при оформлении регулярного пожертвования от $25 в месяц ваш первый взнос будет удвоен благодаря грантовому совпадению 2:1. Это означает, что $25 в месяц превращаются в $75 поддержки, $50 — в $150, а $100 — в $300. Такие регулярные пожертвования критически важны, так как в среднем именно они составляют основу финансирования архива.
Архив хранит 210 петабайт знаний — от сканированных книг до снимков веб-страниц в Wayback Machine — и остаётся полностью бесплатным, без рекламы, продажи данных или outsourcing ключевых технологий. Его независимая инфраструктура требует постоянных инвестиций в серверы, хранение, энергию и команду инженеров. Поддерживая архив регулярным пожертвованием, вы напрямую способствуете сохранению доступа к человеческому знанию для нынешнего и будущих поколений.
Комментарии (213)
В thread обсуждаются предложения 2:1 для IA: такие матчинговые схемы считаются стандартной практикой среди крупных благотворительных организаций, хотя часть комментаторов сомневается в их честности; другие отмечают, что они эмпирически привлекают больше мелких доноров и усиливают их ощущение вклада. При оплате через Google Pay подписка активируется по умолчанию, а отмена возможна только через поддержку, что делает процесс рискованным. IA зарегистрирована как американская некоммерческая организация (501(c)(3)), поэтому доноры из ЕС не получают налоговых чеков от местных фондов; для них рекомендуется SEPA‐перевод на указанный британский счёт (GB74RBOS16107510000470) — это быстрее и дешевле wire‐transfer. Пользователи жалуются на технические ограничения IA (частые 429‐ошибки и тайм‐ауты); предложение ввести отдельный донорский уровень для их обхода может конфликтовать со статусом 501(c)(3). Некоторые считают archive.today надёжнее, так как IA чаще блокирует сайты. В качестве альтернативных моделей финансирования предлагается привлекать спонсоров — крупные хостинг‐провайдеры или компании, занимающиеся ИИ‐скрапингом. Идея полностью волонтёрского обслуживания по модели Red Cross Code4Good считается нереалистичной: инфраструктура требует круглосуточной профессиональной поддержки. Остаётся открытым вопрос о законности и моральной оправданности копирования защищённого контента: одни считают это нарушением прав авторов, другие указывают на общественную ценность доступа к информации.
Three sites made 215,128 “best software” pages for AI. Perplexity cites them 🔥 Горячее 💬 Длинная дискуссия
Исследование показало, что две модели Perplexity при поиске «лучшего» ПО в 380 категориях часто ссылаются на низкокачественные источники. Из 7534 цитат 59,8% ведут на домены хуже 100 000-го места в Tranco, а 23,4% — вовсе вне топ-миллиона. Медианный Tranco-ранг цитируемых доменов — 71 611, а 36,5% из 2055 уникальных доменов не попадают в топ-миллион вообще. Эти домены значительно новее: медианный первый снимок в Wayback Machine — 2020 год против 2011 у популярных источников, и 16,6% из них впервые архивированы в 2025 году или позже.
Треть по частоте цитирования занимает блог Guideflow.com — продавца интерактивных демо, а не площадки с обзорами. Его блог был упомянут 194 раза в 96 категориях (по одной статье на категорию), опередив Gartner. Все три домена, генерирующих машинные «лучшие» списки («Best List» сайтов), появились после декабря 2023 года и, вероятно, находятся под общим управлением из-за одинакового шаблона и инфраструктуры. Они создали 215 128 страниц вида «best <category>». Несмотря на это, исследование не оценивало, влияют ли такие источники на качество рекомендаций — только документировало, из чего состоит доказательная база моделей. Wikipedia, для сравнения, была цитирована всего три раза. Полные данные и код доступны на сайте автора.
Комментарии (213)
Обсуждение выявило несколько ключевых проблем LLM-поиска: - Модели цитируют низкокачественные источники и генерируют ложные факты на основе единичных соцсетевых упоминаний, формируя цикл дезинформации. - LLM предпочитают собственные тексты из-за совпадения с обучающими паттернами, даже когда они хуже человеческих. - Модели не оценивают качество источников, принимая за истину даже Reddit-комментарии с опечатками. - SEO-фирмы генерируют контент с минимальным KL-расхождением от ответов моделей; сегмент «best software» — самый спамный, с сайтами, созданными исключительно для цитирования LLM. - Perplexity и другие LLM-поисковики жертвуют качеством ради скорости: ссылки не соответствуют тексту. - Модели ассоциируют определённые фразы («load-bearing», «crucial») с качеством, позволяя искусственно улучшать тексты без изменения смысла. - LLM не различают авторство и оценивают текст по стилистическим шаблонам, а не по реальной эффективности. - В нишевых SaaS пользователи отмечают, что LLM рекомендуют фиктивные «лучшие» решения вместо реальных инструментов. - Практика «AI SEO» — массовая генерация страниц «best X» на несуществующих доменах, идеальных для цитирования. - Многие пользователи возвращаются к вручную отобранным источникам (Wikipedia, arXiv, Reddit), считая открытый веб непригодным для достоверного поиска. - Замкнутый круг: AI генерирует сайты → LLM их цитирует → сайты попадают в обучающие данные → AI генерирует ещё больше. - AI-статьи стали шаблонными и пустыми, что снижает доверие к выдаче моделей. - Модели не различают рекламу, аффилированный и независимый контент. - AI-поиск, по мнению части пользователей, уничтожил возможность находить новые решения — результаты сводятся к рерайту популярных шаблонов. - Спор: один пользователь утверждает, что OpenAI поддерживает исключение доменов, но другие отмечают, что инструменты поиска Anthropic и OpenAI пока не позволяют эффективно фильтровать шум.
FBI tries to unmask owner of archive.is 🔥 Горячее 💬 Длинная дискуссия
FBI потребовала от провайдера Tucows предоставить данные пользователей Archive.today — одного из самых загадочных и известных интернет-ресурсов. Сервис, работающий более десяти лет, позволяет сохранять и просматривать предыдущие версии веб-страниц, подобно Wayback Machine, но с минимальными ограничениями. Судебный ордер обязал компанию передать информацию о пользователях, что вызвало обеспокоенность в сообществе.
Archive.today привлекает внимание из-за своей политики минимального вмешательства в контент, что делает его популярным инструментом для сохранения информации. Сервис активно используется журналистами, исследователями и активистами для архивации материалов, которые могут быть удалены или изменены. Требование спецслужб ставит под вопрос конфиденциальность пользователей и принципы работы подобных платформ.
Комментарии (444)
- FBI расследует archive.today как часть уголовного дела, хотя неясно, какое именно преступление подразумевается.
- Сайт используется для обхода платных стен, что делает его целью для издателей, которые не могут предложить удобный UX.
- Появляются сообщения, что оператор может быть в России, что вызывает вопросы о том, почему ФБР не может просто заблокировать сайт, если бы это было правдой.
- Пользователи HN обсуждают, что если бы archive.today исчезнет, это лишит их возможности делиться ссылками на статьи без paywall, что вызывает тревогу.
- Некоторые комментаторы подчеркивают, что archive.today использует ботнет и Tor для обхода блокировок, что может быть причиной, по которой ФБР считает его угрозой.
1 Trillion Web Pages Archived 🔥 Горячее
Интернет-архив достигнет триллиона сохранённых веб-страниц в Wayback Machine в октябре — это результат почти 30 лет работы с библиотеками по всему миру для создания коллективной цифровой памяти человечества. Масштаб достижения подчёркивает важность сохранения онлайн-истории: от глобальных новостей до личных страниц, которые иначе были бы утрачены.
В честь события запланирована серия мероприятий, включая концерт Del Sol Quartet, диалог Тима Бернерса-Ли и Брюстера Кейла о будущем интернета, виртуальный форум библиотечных лидеров и экскурсии по физическому архиву. Эти события не только отмечают веху, но и подчёркивают необходимость продолжать совместными усилиями сохранять веб-контент для будущих поколений.
Комментарии (81)
- Пользователи предлагают технические улучшения для Internet Archive: распределенное пиринговое зеркалирование (по типу torrent), интеграция с IPFS, улучшение поиска по содержимому страниц и статистики.
- Обсуждаются вопросы масштаба и инфраструктуры архива: объем данных, надежность хранения, защита от несанкционированного изменения, сотрудничество с Common Crawl и ArchiveTeam.
- Высказывается критика в адрес скорости работы сервиса, сложности извлечения данных и точности метрик, а также опасения о приватности из-за отсутствия возможности удалить информацию.
- Пользователи делятся инструментами для работы с архивом (например, pywaybackup) и альтернативными сервисами (archive.is).
- Участники выражают благодарность и поддержку Internet Archive, интересуются мероприятиями организации и возможностями трудоустройства.
ArchiveTeam has finished archiving all goo.gl short links 🔥 Горячее
Как запустить ArchiveTeam Warrior
Это виртуальная машина для архивации сайтов. Работает на Windows, macOS, Linux через VirtualBox или VMware, не влияет на систему, использует лишь трафик и немного диска.
Быстрый старт (VirtualBox)
- Скачайте образ (357 МБ).
- VirtualBox → Файл → Импортировать → выбрать файл.
- Запустите ВМ; она обновится и предложит открыть браузер.
После запуска
- Откройте http://localhost:8001/
- Укажите имя для таблицы лидеров.
- Выберите проект во вкладке «All projects» или оставьте «ArchiveTeam’s Choice» для автоматического выбора приоритетной задачи.
Goo-gl tracker
Загрузка…
Комментарии (90)
- ArchiveTeam (не Archive.org) спас 3,75 млрд коротких ссылок goo.gl и весь их контент (91 ТиБ) до отключения Google 25 августа.
- Данные уже поступают в Wayback Machine; сами файлы WARC пока закрыты «access-restricted».
- Участники просто запускали Docker-контейнер, перебирая пространство URL, чтобы не попасть под бан.
- Поднимались идеи блокчейн/P2P-краулера и сравнение с CommonCrawl, но основная цель — предотвратить link rot.
- Reddit и Twitter тоже архивировались (Pushshift, ArcticShift, AcademicTorrents), пока API не закрыли.