Keep Our Servers Running 🔥 Горячее 💬 Длинная дискуссия
В сентябре Internet Archive запускает акцию: при оформлении регулярного пожертвования от $25 в месяц ваш первый взнос будет удвоен благодаря грантовому совпадению 2:1. Это означает, что $25 в месяц превращаются в $75 поддержки, $50 — в $150, а $100 — в $300. Такие регулярные пожертвования критически важны, так как в среднем именно они составляют основу финансирования архива.
Архив хранит 210 петабайт знаний — от сканированных книг до снимков веб-страниц в Wayback Machine — и остаётся полностью бесплатным, без рекламы, продажи данных или outsourcing ключевых технологий. Его независимая инфраструктура требует постоянных инвестиций в серверы, хранение, энергию и команду инженеров. Поддерживая архив регулярным пожертвованием, вы напрямую способствуете сохранению доступа к человеческому знанию для нынешнего и будущих поколений.
Комментарии (213)
В thread обсуждаются предложения 2:1 для IA: такие матчинговые схемы считаются стандартной практикой среди крупных благотворительных организаций, хотя часть комментаторов сомневается в их честности; другие отмечают, что они эмпирически привлекают больше мелких доноров и усиливают их ощущение вклада. При оплате через Google Pay подписка активируется по умолчанию, а отмена возможна только через поддержку, что делает процесс рискованным. IA зарегистрирована как американская некоммерческая организация (501(c)(3)), поэтому доноры из ЕС не получают налоговых чеков от местных фондов; для них рекомендуется SEPA‐перевод на указанный британский счёт (GB74RBOS16107510000470) — это быстрее и дешевле wire‐transfer. Пользователи жалуются на технические ограничения IA (частые 429‐ошибки и тайм‐ауты); предложение ввести отдельный донорский уровень для их обхода может конфликтовать со статусом 501(c)(3). Некоторые считают archive.today надёжнее, так как IA чаще блокирует сайты. В качестве альтернативных моделей финансирования предлагается привлекать спонсоров — крупные хостинг‐провайдеры или компании, занимающиеся ИИ‐скрапингом. Идея полностью волонтёрского обслуживания по модели Red Cross Code4Good считается нереалистичной: инфраструктура требует круглосуточной профессиональной поддержки. Остаётся открытым вопрос о законности и моральной оправданности копирования защищённого контента: одни считают это нарушением прав авторов, другие указывают на общественную ценность доступа к информации.
Google Books (or similar) all book scans – $200k bounty (2025) 🔥 Горячее 💬 Длинная дискуссия
Google Books и аналогичные сервисы хранят миллионы сканов, но доступ к полному тексту предоставляется только через поисковые выдержки — короткие фрагменты, показывающие несколько строк вокруг найденного запроса. Администрация проекта предлагает выкуп в размере $200 000 за любой способ, позволяющий выгрузить эти сканы полностью, при условии, что метод будет масштабируемым. Если у вас есть прототип, лучше связаться с ними на раннем этапе, чтобы совместно отточить решение; особенно ценят такие находки, если вы работаете в Google и можете «украсть» данные, которые обычно недоступны.
Бонус распространяется не только на Google Books, но и на любые аналогичные архивы, где редкие издания зачастую остаются «заперты» в поиске. Эти выдержки обычно состоят из лишь двух‑трёх строк, что делает процесс извлечения особенно сложным, но также ценным. В объявлении сказано: «Если вы найдете способ, который сможет вытащить целый том из крошечных вырезок, вы станете легендой архивов». При этом $200 000 — символическая сумма для корпорации, но признание архивариуса гарантирует славу; команда подчёркивает, что при успешном масштабировании bounty может быть расширен, а участники получат доступ к тестовым датасетам через чат #annas:archivecommunication.org.
Комментарии (350)
- Ограниченный выбор английских книг в некоторых странах вынуждает пользователей обращаться к Anna's Archive и Z‑Library.
- Проект предлагает выплаты за сборники (например, редкие издания, данные Internet Archive) и ищет финансирование от доноров.
- Обсуждаются юридические и практические проблемы доступа к цифровым книгам, лицензированию и обходу блокировок.
- Споры о законности архивирования, возможных последствиях для архивистов и распределении вознаграждения за данные.
1 Trillion Web Pages Archived 🔥 Горячее
Интернет-архив достигнет триллиона сохранённых веб-страниц в Wayback Machine в октябре — это результат почти 30 лет работы с библиотеками по всему миру для создания коллективной цифровой памяти человечества. Масштаб достижения подчёркивает важность сохранения онлайн-истории: от глобальных новостей до личных страниц, которые иначе были бы утрачены.
В честь события запланирована серия мероприятий, включая концерт Del Sol Quartet, диалог Тима Бернерса-Ли и Брюстера Кейла о будущем интернета, виртуальный форум библиотечных лидеров и экскурсии по физическому архиву. Эти события не только отмечают веху, но и подчёркивают необходимость продолжать совместными усилиями сохранять веб-контент для будущих поколений.
Комментарии (81)
- Пользователи предлагают технические улучшения для Internet Archive: распределенное пиринговое зеркалирование (по типу torrent), интеграция с IPFS, улучшение поиска по содержимому страниц и статистики.
- Обсуждаются вопросы масштаба и инфраструктуры архива: объем данных, надежность хранения, защита от несанкционированного изменения, сотрудничество с Common Crawl и ArchiveTeam.
- Высказывается критика в адрес скорости работы сервиса, сложности извлечения данных и точности метрик, а также опасения о приватности из-за отсутствия возможности удалить информацию.
- Пользователи делятся инструментами для работы с архивом (например, pywaybackup) и альтернативными сервисами (archive.is).
- Участники выражают благодарность и поддержку Internet Archive, интересуются мероприятиями организации и возможностями трудоустройства.
Internet Archive's big battle with music publishers ends in settlement 🔥 Горячее
Интернет-архив урегулировал многолетний судебный спор с крупными лейблами, включая UMG, Capitol и Sony, по поводу проекта Great 78, оцифровывавшего хрупкие записи на шеллаке. Детали соглашения остаются конфиденциальными, но стороны официально уведомили суд о завершении дела. Изначально издатели требовали компенсацию в $400 млн, утверждая о потере потокового дохода, а позже увеличили сумму до $700 млн, добавив новые претензии.
Хотя защита настаивала на скромном масштабе использования архивных записей и оценке ущерба всего в $41 тыс., риски для некоммерческого архива были огромны. Это уже второе крупное урегулирование после проигранного в прошлом году дела с книжными издателями, что подчёркивает растущее давление на цифровые архивы в условиях ужесточения авторского права.
Комментарии (148)
- Internet Archive подвергается судебным искам за нарушение авторских прав, в отличие от крупных платформ вроде YouTube, которые защищены системами вроде Content ID.
- Существуют опасения, что из-за спорного контента и неоднозначных решений (например, «Национальной Чрезвычайной Библиотеки») будущее архива под угрозой, несмотря его огромную ценность для человечества.
- Некоторые пользователи критикуют организацию за превращение в подобие пиратского сайта из-за размещения современного, а не только архивного контента.
- Обсуждаются проблемы управления и финансирования архива, бюджет которого сравнительно мал, а также роль его совета директоров.
- Предлагаются радикальные решения, такие как перемещение юрисдикции архива в страну без строгих законов об авторском праве, чтобы избежать давления.