Hacker News Digest

Тег: #wikipedia

Постов: 5

Three sites made 215,128 “best software” pages for AI. Perplexity cites them (trellner.com) 🔥 Горячее 💬 Длинная дискуссия

Исследование показало, что две модели Perplexity при поиске «лучшего» ПО в 380 категориях часто ссылаются на низкокачественные источники. Из 7534 цитат 59,8% ведут на домены хуже 100 000-го места в Tranco, а 23,4% — вовсе вне топ-миллиона. Медианный Tranco-ранг цитируемых доменов — 71 611, а 36,5% из 2055 уникальных доменов не попадают в топ-миллион вообще. Эти домены значительно новее: медианный первый снимок в Wayback Machine — 2020 год против 2011 у популярных источников, и 16,6% из них впервые архивированы в 2025 году или позже.

Треть по частоте цитирования занимает блог Guideflow.com — продавца интерактивных демо, а не площадки с обзорами. Его блог был упомянут 194 раза в 96 категориях (по одной статье на категорию), опередив Gartner. Все три домена, генерирующих машинные «лучшие» списки («Best List» сайтов), появились после декабря 2023 года и, вероятно, находятся под общим управлением из-за одинакового шаблона и инфраструктуры. Они создали 215 128 страниц вида «best <category>». Несмотря на это, исследование не оценивало, влияют ли такие источники на качество рекомендаций — только документировало, из чего состоит доказательная база моделей. Wikipedia, для сравнения, была цитирована всего три раза. Полные данные и код доступны на сайте автора.

by jakobgreenfeld • 02 сентября 2026 г. в 13:59 • 436 points

ОригиналHN

#gartner#guideflow.com#llm#perplexity#tranco#wayback-machine#wikipedia

Комментарии (213)

Обсуждение выявило несколько ключевых проблем LLM-поиска: - Модели цитируют низкокачественные источники и генерируют ложные факты на основе единичных соцсетевых упоминаний, формируя цикл дезинформации. - LLM предпочитают собственные тексты из-за совпадения с обучающими паттернами, даже когда они хуже человеческих. - Модели не оценивают качество источников, принимая за истину даже Reddit-комментарии с опечатками. - SEO-фирмы генерируют контент с минимальным KL-расхождением от ответов моделей; сегмент «best software» — самый спамный, с сайтами, созданными исключительно для цитирования LLM. - Perplexity и другие LLM-поисковики жертвуют качеством ради скорости: ссылки не соответствуют тексту. - Модели ассоциируют определённые фразы («load-bearing», «crucial») с качеством, позволяя искусственно улучшать тексты без изменения смысла. - LLM не различают авторство и оценивают текст по стилистическим шаблонам, а не по реальной эффективности. - В нишевых SaaS пользователи отмечают, что LLM рекомендуют фиктивные «лучшие» решения вместо реальных инструментов. - Практика «AI SEO» — массовая генерация страниц «best X» на несуществующих доменах, идеальных для цитирования. - Многие пользователи возвращаются к вручную отобранным источникам (Wikipedia, arXiv, Reddit), считая открытый веб непригодным для достоверного поиска. - Замкнутый круг: AI генерирует сайты → LLM их цитирует → сайты попадают в обучающие данные → AI генерирует ещё больше. - AI-статьи стали шаблонными и пустыми, что снижает доверие к выдаче моделей. - Модели не различают рекламу, аффилированный и независимый контент. - AI-поиск, по мнению части пользователей, уничтожил возможность находить новые решения — результаты сводятся к рерайту популярных шаблонов. - Спор: один пользователь утверждает, что OpenAI поддерживает исключение доменов, но другие отмечают, что инструменты поиска Anthropic и OpenAI пока не позволяют эффективно фильтровать шум.

Wikipedia says traffic is falling due to AI search summaries and social video (techcrunch.com) 🔥 Горячее 💬 Длинная дискуссия

Wikipedia столкнулась со значительным снижением трафика — на 8% в годовом исчислении, согласно данным Wikimedia Foundation. Основными причинами этого падения стали ИИ-резюме в поисковых системах, которые предоставляют ответы без необходимости перехода на сайт, а также популярность коротких видео в социальных сетях, которые становятся основным источником информации для многих пользователей. Эти изменения отражают более широкую трансформацию поведения пользователей в интернете.

Несмотря на это, Wikipedia по-прежнему остаётся одним из самых надёжных источников информации, часто называемым "последним хорошим сайтом" в интернете, заполненном токсичным контентом. Фонд Wikimedia ищет способы адаптироваться к новой реальности, где пользователи всё реже совершают прямые переходы на сайт для получения знаний, предпочитая получать информацию через ИИ-ассистентов и развлекательный формат.

by gmays • 21 октября 2025 г. в 01:29 • 377 points

ОригиналHN

#google#llm#search#social-media#wikipedia

Комментарии (349)

  • Трафик и финансирование: спад трафика не обязательно плох — он может снижать расходы на хостинг, а пожертвования всё растут.
  • AI и источники: LLM не заменяет Википедию, а лишь упрощает доступ к ней; сама Википедия остаётся ключевым источником.
  • **Финансовая устойчивость фонда: у фонда есть резервы, и он не зависит от рекламы, поэтому падение трафика не влияет на доходы.
  • **Конфликт интересов Google и Википедии: Google не заинтересован в поддержании Википедии, поскольку их AI-саммари оттягивает трафик и, следовательно, доходы от рекламы.

Wikipedia survives while the rest of the internet breaks (theverge.com) 🔥 Горячее 💬 Длинная дискуссия

Wikipedia живёт, потому что скучна
Пока весь интернет рушится, «вики» стоит. Её секрет — не в деньгах, а в правилах: нейтральный тон, проверяемые источники, консенсус редакторов.

Салют Маска как тест прочности
20 января 2025 года Илон Маск показал жест, похожий на нацистское приветствие. Первый редактор добавил фразу в статью, второй — удалил: биографии живых людей защищены строже. Началась многочасовая дискуссия: это был нацистский салют, неловкий жест или провокация? Вместо войны правок редакторы перешли к голосованию и источникам.

Почему это работает

  • Правила > эмоций: каждое утверждение требует двух независимых публикаций.
  • Скорость через процесс: новость появляется, когда её подтвердят, а не когда взорвётся твиттер.
  • Скука как щит: отсутствие лайков и алгоритмов не даёт вирусному гневу захватить платформу.

Итог: Wikipedia остаётся последним островком фактов в океане контента, который ломается каждый день.

by leotravis10 • 04 сентября 2025 г. в 15:30 • 516 points

ОригиналHN

#community-management#content-moderation#fact-checking#neutrality#open-source#wikipedia

Комментарии (390)

  • Участники спорят, действительно ли Wikipedia «последний добрый остров» интернета: одни хвалят, другие критикуют за политическую ангажированность и «захваченность» тематическими кланами.
  • Подчёркивают, что английская версия ещё держится, а вот неанглоязычные часто превращаются в пропаганду и исторические фальсификации.
  • Отмечают рост давления со стороны властей (пример – запросы конгрессменов раскрыть имена редакторов) и опасность массовых доносов/доксинга внутри сообщества.
  • Многие советуют читать не только статью, но и страницу обсуждения, а также историю правок, чтобы видеть, какие точки зрения вырезали и почему.
  • Часть комментаторов считает, что выживание Wikipedia возможно именно благодаря медленному, «не-стартаповому» принципу и отсутствию прибыли, но ресурс уже «подсел» на пожертвования и всё чаще поддаётся внешнему влиянию.

Wikipedia loses challenge against Online Safety Act (bbc.com) 🔥 Горячее 💬 Длинная дискуссия

Wikimedia Foundation проиграла судебный спор против положений Закона об онлайн-безопасности, требующих от крупных платформ верификации личности пользователей. Фонд утверждал, что это подвергает риску безопасность и права добровольных редакторов Wikipedia, но Высокий суд отказал в иске.

Суд подчеркнул, что Ofcom и правительство обязаны защитить Wikipedia. Правительство приветствовало решение, заявив, что оно поможет внедрить закон и сделать интернет безопаснее.

Иск касался классификации Wikipedia как «категория 1» — самый строгий уровень регулирования, изначально предназначенный для крупных соцсетей. Wikimedia считает, что правила слишком широкие и логически не выдержаны.

by phlummox • 11 августа 2025 г. в 16:33 • 1013 points

ОригиналHN

#ofcom#online-safety-act#uk#wikimedia-foundation#wikipedia

Комментарии (784)

  • Высокий суд отклонил иск Wikimedia против обязанностей Category 1 в UK Online Safety Act, что ставит под угрозу работу Wikipedia в Великобритании.
  • Участники считают закон чрезмерным: он затрагивает даже сайты без рекомендательных алгоритмов и может привести к обязательной верификации пользователей.
  • Многие предлагают Wikipedia просто заблокировать доступ из UK, чтобы продемонстрировать последствия закона и вызвать общественный резонанс.
  • Обсуждаются и практические вопросы: имеет ли Wikimedia активы или сотрудников в UK, и как реально будет наложить штрафы, если организация проигнорирует требования.

Wikimedia Foundation Challenges UK Online Safety Act Regulations (wikimediafoundation.org) 🔥 Горячее 💬 Длинная дискуссия

Фонд Wikimedia оспаривает положения британского «Закона о безопасности в интернете»

11 августа Высокий суд Лондона отклонил иск Фонда Wikimedia против Categorisation Regulations «Закона о безопасности в интернете» (OSA). Суд подтвердил, что:

  • Wikipedia имеет «значительную ценность» и безопасна для пользователей;
  • неправильная категоризация может нарушить права волонтёров;
  • обязанность защищать проект ложится на Ofcom и британское правительство.

Фонд продолжит добиваться гарантий, чтобы свободное знание оставалось доступным.

by danso • 11 августа 2025 г. в 12:38 • 566 points

ОригиналHN

#ofcom#online-safety-act#uk-government#wikimedia-foundation#wikipedia

Комментарии (187)

  • Участники обсуждают, стоит ли Wikimedia блокировать доступ из Великобритании, чтобы привлечь внимание СМИ и заставить политиков изменить закон.
  • Некоторые считают, что Wikipedia может просто отключить рекомендательные алгоритмы для британских пользователей, чтобы избежать категоризации как "сервис первой категории".
  • Другие подчеркивают, что отказ от работы в Великобритании может стать прецедентом для других стран, и предлагают просто игнорировать требования, как это делают в более авторитарных государствах.
  • Участники также отмечают, что Wikimedia уже проиграла судебный иск, и теперь возможны санкции, блокировки или аресты сотрудников при въезде в Великобританию.