Hacker News Digest

Обновлено: 15 сентября 2026 г. в 06:46

Постов: 2179 • Страница 119/218

Karpathy on DeepSeek-OCR paper: Are pixels better inputs to LLMs than text? (twitter.com) 🔥 Горячее

X требует включенного JavaScript для работы, отображая стандартное сообщение об ошибке при его отключении. Пользователям предлагают либо включить JavaScript, либо перейти в поддерживаемый браузер, ссылаясь на раздел помощи с полным списком совместимых браузеров. Сообщение также содержит ссылки на юридические документы: условия использования, политику конфиденциальности, политику cookie, юридические данные и информацию о рекламе.

В случае возникновения проблемы пользователи видят кнопку "Попробовать снова" и предупреждение о возможных конфликтах с расширениями для конфиденциальности. Рекомендуется отключить такие расширения перед повторной попыткой доступа к платформе. Это типичное требование современных веб-сервисов, использующих JavaScript для динамической загрузки контента и взаимодействия с пользователем.

by JnBrymn • 21 октября 2025 г. в 17:43 • 368 points

ОригиналHN

#javascript#llm#machine-learning#natural-language-processing#ocr#twitter

Комментарии (146)

  • Обсуждение вращается вокруг идеи, что токенизация текста может быть неоптимальна, и что визуальное восприятие текста может быть более естественным способом подачи информации для модели.
  • Участники обсуждают, что визуальное воспринятие текста может быть более естественным способом подачи информации для модели, и что токенизация текста может быть неоптимальна.
  • Обсуждается, что визуальное воспринятие текста может быть более естественным способом подачи информации для модели, и что токенизация текста может быть неоптимальна.
  • Участники обсуждают, что визуальное восприятие текста может быть более естественным способом подачи информации для модели, и что токенизация текста может быть неоптимальна.

ChatGPT Atlas (chatgpt.com) 🔥 Горячее 💬 Длинная дискуссия

ChatGPT Atlas — это браузерное расширение, интегрирующее ChatGPT в веб-браузер для мгновенных ответов и помощи в задачах. Основные функции включают боковую панель для суммирования контента, сравнения продуктов и анализа данных на любом сайте, а также режим "агента", который взаимодействует с веб-страницами под контролем пользователя (например, для планирования поездок). Пользователи могут выбирать, что запоминает ChatGPT, и управлять приватностью — решать, какие сайты видны ИИ, очищать историю или использовать инкогнито.

Расширение также предлагает "курсора-помощника" — выделение текста в документах или письмах дает мгновенный доступ к помощи ChatGPT. Важно, что Atlas доступен только для macOS, а агент-режим работает в предварительном просмотре для платных аккаунтов Plus, Pro и Business. Дополнительные возможности включают умный поиск по тексту, изображениям и видео, а также персонализацию интерфейса с настройками цветов и закладок.

by easton • 21 октября 2025 г. в 17:18 • 714 points

ОригиналHN

#browser-extensions#data-collection#llm#macos#privacy#user-interface-customization#web-browsing

Комментарии (679)

  • Обсуждение в основном вращается вокруг трёх тем: приватность и контроль над данными, монополизация браузеров и их последствий, а также влияние на пользователей и разработчиков.
  • Участники обсуждают, что OpenAI и другие компании, разрабатывающие браузеры, могут собирать и использовать личные данные пользователей, что вызывает серьёзные опасения по поводу приватности.
  • Также обсуждается, что такие браузеры могут привести к монополизации рынка браузеров, поскольку они могут быть использованы для сбора данных и влияния на пользователей.
  • Некоторые участники также выражают обеспокоенность по поводу того, что такие браузеры могут быть использованы для сбора данных и влияния на пользователей.

Build your own database (nan.fyi) 🔥 Горячее

Статья представляет пошаговое руководство по созданию простой key-value базы данных с нуля. Начальный подход предполагает хранение данных в обычном файле, где каждая строка содержит пару ключ-значение. Однако такой метод неэффективен для обновлений и удалений, так как требует перемещения всех последующих данных. Решением становится использование append-only файла, где записи являются неизменяемыми, а обновления и удаления обрабатываются через добавление новых записей и специальные "надгробные" метки.

Основные проблемы этого подхода — неограниченный рост файла и медленный поиск, так как для нахождения ключа может потребоваться просмотреть все записи. В примере показано, что файл базы данных может содержать множество записей, но только небольшая часть из них представляет актуальные данные, в то время как остальные являются удаленными или устаревшими. Для решения проблемы роста файла необходим механизм периодического "сжатия", который бы удалял нерелевантные данные и уменьшал размер файла.

by nansdotio • 21 октября 2025 г. в 16:31 • 506 points

ОригиналHN

#acid#bitcask#data-compression#databases#key-value#lsm-tree#replication#riak-core

Комментарии (78)

  • Обсуждение охватывает вопросы от дизайна и UX до фундаментальных концепций, таких как ACID, индексы и LSM-деревья, и даже до того, что не стоит писать свою СУБД, если можно использовать готовую.
  • Участники обмениваются советами по инструментам вроде riak_core и Bitcask, обсуждают проблемы репликации и отказоустойчивости, и делятся личными историями о том, как они писали свои собственные базы данных.
  • Некоторые комментарии поднимают вопросы о правильном подходе к обучению и документации, а также о том, как сделать так, чтобы читатели могли бы легко следить за обсуждением и не теряли нитку.
  • Некоторые участники делятся ссылками на полезные ресурсы, такие как "Designing Data-Intensive Applications" и "Build Your Own Database".
  • Некоторые участники поднимают вопросы о том, как лучше всего подавать контент, чтобы он был интерактивным и в то же время не перегружал читателя, и обсуждают, как лучше всего структурировать и визуализировать информацию.
  • Некоторые участники делятся личными историями о том, как они писали свои собственные базы данных, и обсуждают, какие вызовы они встретились и как они их преодолели.

Foreign hackers breached a US nuclear weapons plant via SharePoint flaws (csoonline.com) 🔥 Горячее 💬 Длинная дискуссия

Предоставленный текст содержит только навигационную структуру сайта CSO Online, а не саму статью о кибератаке. Судя по заголовку, речь идет о взломе американского ядерного объекта иностранными хакерами через уязвимости в SharePoint. Вероятно, в статье подробно описаны детали инцидента, включая то, как злоумышленники использовали недостатки в популярной платформе Microsoft для проникновения в критически важную инфраструктуру. Без доступа к полному тексту невозможно предоставить точный пересказ с ключевыми фактами, цифрами или цитатами.

by zdw • 21 октября 2025 г. в 15:51 • 390 points

ОригиналHN

#cloud-security#cybersecurity#microsoft#national-security#sharepoint#vendor-lock-in

Комментарии (303)

  • Обсуждение в основном вращается вокруг критики Microsoft-стека, но при этом поднимаются вопросы безопасности, ответственности вендора и даже культуры найма в целом.
  • Участники обмениваются личными историями, где Microsoft-ориентированные компании отвергают кандидатов только за то, что те используют их продукты.
  • Некоторые комментаторы утверждают, что использование Microsoft-стека само по себе является показателем плохой ИТ-культуры в компании.
  • Другие спорят, что важно различать использование продуктов и саму культуру найма и отношение к сотрудникам.
  • Обсуждение также затрагивает вопросы национальной безопасности, критикуя использование облачных сервисов и вендор лок-ина.

LLMs can get "brain rot" (llm-brain-rot.github.io) 🔥 Горячее 💬 Длинная дискуссия

Исследователи из Техасского университета и Университета Пердью обнаружили, что большие языковые модели подвержены "гниению мозга" — когнитивному ухудшению при обучении на низкокачественном контенте. Эксперименты с четырьмя LLM, обучавшихся на "мусорных" данных Twitter/X, показали значительное снижение (Hedges' g > 0.3) способностей к рассуждениям, пониманию длинных контекстов и безопасности, а также рост "темных черт" вроде психопатии. При смешивании мусорных и качественных данных наблюдалось дозозависимое ухудшение: например, точность на ARC-Challenge с цепочкой мыслей падала с 74.9% до 57.2% при увеличении доли мусора с 0% до 100%.

Главной проблемой стал пропуск или обрыв цепочек рассуждений у моделей. Хотя попытки исправить ситуацию через настройку инструкций и обучение на чистых данных частично улучшили показатели, полностью восстановить исходный уровень не удалось, что указывает на стойкое смещение представлений. Интересно, что популярность твита оказалась лучшим индикатором эффекта "гниения мозга", чем его семантическое качество, что подчеркивает важность не только содержания, но и формата данных для обучения ИИ.

by tamnd • 21 октября 2025 г. в 14:24 • 446 points

ОригиналHN

#anthropic#data-quality#large-language-models#llm#machine-learning#openai#twitter

Комментарии (275)

  • Обсуждение свелось к тому, что качество данных определяет качество модели: «мусор на входе — мусор на выходе».
  • Участники отмечают, что если в корпусе есть токсичные или низкокачественные тексты, то модель будет деградировать так же, как и человек, потребляющий такой контент.
  • Кто-то вспомнил, что в 2024 г. OpenAI и Anthropic уже публиковали статьи о том, что «brain rot» влияет на LLM, но сообщество в целом не придало этому значения.
  • Другой участник подметил, что если мы не можем контролировать, что именно модель «читает» в сети, то мы не должны удивляться, что она ведет себя как токсичный токсик.
  • Несколько человек согласились, что метафора «brain rot» сама по себе вводит в заблуждение, потому что модели не имеют ни мозга, ни познавательных способностей, и что важно фокусироваться на том, что мы действительно имеем дело с алгоритмами, а не с «искусственным мозгом».

NASA chief suggests SpaceX may be booted from moon mission (cnn.com) 🔥 Горячее 💬 Длинная дискуссия

Глава NASA намекнул на возможное расторжение контракта SpaceX по программе посадки на Луну, что ставит под угрозу один из ключевых элементов космической программы США. Контракт стоимостью 2,9 миллиарда долларов был заключен в 2021 году для разработки лунного модуля Starship, который должен доставить астронавтов на поверхность Луны в рамках программы Artemis. По словам главы NASA, существуют серьезные сомнения в способности SpaceX выполнить обязательства в установленные сроки.

SpaceX столкнулась с задержками в разработке Starship, включая неудачные испытания ракеты-носителя. NASA выразила обеспокоенность тем, что задержки могут повлиять на график всей программы Artemis, которая уже перенесена несколько раз. Агенство рассматривает альтернативные варианты, включая привлечение других компаний, таких как Blue Origin и Dynetics, которые ранее проиграли тендер, но теперь могут получить шанс участвовать в лунной программе.

by voxleone • 21 октября 2025 г. в 12:58 • 373 points

ОригиналHN

#artemis#blue-origin#dynetics#falcon-9#nasa#orion#sls#spacex#starship

Комментарии (985)

  • Проект Artemis оказался заложником политики: SLS и Orion продолжают получать финансирование, несмотря на отставание графика и бюджета, в то время как более современные и дешёвые альтернативы уже существуют.
  • Контракты на поставку ракет и космических кораблей для миссии Artemis были отменены, потому что SpaceX не может быть удобным для политического статус-кво, в то время как Boeing и другие подрядчики продолжают получать деньги несмотря на отсутствие прогресса.
  • Попытка NASA в 2025 году отменить контракт на использование Starship в качестве лунного посадочного модуля была вызвана нежеланием признать, что SpaceX разработал более дешёвую и способную к повторному использованию альтернативу, которая делает SLS и Orion неактуальными.
  • В то время как Starship предлагает революционизировать космическую индустрию так же, как Falcon 9 это сделал для орбитальных запусков, политика вместо этого требует продолжения использования неэффективных и дорогих контрактов, которые не могут даже предоставить доступ к космосу.
  • Вопрос остаётся открытым: почему NASA должна продолжать тратить десятки миллиардов долларов на контракты, которые не могут даже доставить груз на орбиту, в то время как уже существующая технология может это сделать в разы дешевле и быстрее?

Neural audio codecs: how to get audio into LLMs (kyutai.org) 🔥 Горячее

Текущие речевые LLM работают как обертка: преобразуют речь в текст, обрабатывают его и затем синтезируют ответ обратно в речь, что не позволяет улавливать нюансы интонации, сарказма или эмоций. Даже передовые модели вроде Gemini или ChatGPT с продвинутым голосовым режимом не могут ответить на вопрос о высоте голоса, демонстрируя отставание речевых моделей от текстовых. Проблема в том, что за одну секунду аудио содержится десятки тысяч выборок, в отличие от нескольких слов в тексте, что делает обработку аудио значительно сложнее.

Решением являются нейроаудио-кодеки, такие как Mimi от Kyutai, которые сжимают аудио в более управляемые дискретные токены, аналогично токенизации текста. Вместо предсказания аудио выборка за выборкой, как в ранних моделях вроде WaveNet, кодеки преобразуют непрерывные значения в 256 дискретных "вёдер" с помощью μ-law алгоритма. Этот подход позволяет LLM обрабатывать аудио как последовательность токенов, предсказывать продолжение и затем декодировать обратно в аудио, открывая путь к настоящему пониманию речи.

by karimf • 21 октября 2025 г. в 12:55 • 410 points

ОригиналHN

#audio-codecs#audio-processing#kyutai#law#llm#neural-networks#speech-recognition#tokenization#tts#wavenet

Комментарии (115)

  • Обсуждение охватывает широкий спектр тем: от токенизации аудио до фундаментальных вопросов о том, как моделируются речь и звук, и почему это важно для будущего ИИ.
  • Участники обсуждают, что вместо попыток заставить модели распознавать и генерировать речь, мы должны сосредоточиться на создании моделей, которые могут работать с непрерывными сигналами и, таким образом, избегая необходимости в токенизации аудио.
  • Обсуждается, что вместо того, чтобы полагаться на существующие аудио кодеки, такие как MP3, мы должны развивать нейрональные кодеки, которые могут быть обучены вместе с моделью и, таким образом, позволяя ей напрямую работать с компактным, дискретным представлением аудио.
  • Участники также обсуждают, что вместо того, чтобы пытаться обучить модель на транскрибированном тексте, мы должны использовать аудио-ориентированные данные, которые включают в себе всю информацию, которая теряется при транскрибции. Это может включать в себе обучение модели на транскрибированном тексте, который может быть использован для тренировки TTS-моделей.

SpaceX is behind schedule, so NASA will open Artemis III contract to competition (theregister.com)

NASA откроет контракт на разработку лунного модуля для миссии Artemis III для открытого конкурса, отказавшись от первоначального плана передать контракт компании SpaceX. Это решение последовало после критики со стороны Сената и других компаний, таких как Blue Origin и Dynetics, которые оспаривали первоначальное выделение SpaceX всей суммы в $2.9 млрд без конкурентного тендера.

Программа Artemis III должна вернуть людей на Луну впервые с 1972 года, с запланированной высадкой в 2025-2026 годах. NASA теперь планирует разделить контракт на несколько частей, позволив нескольким компаниям разработать свои варианты лунного модуля. Это изменение политики направлено на стимулирование инноваций и снижение рисков за счет диверсификации поставщиков, хотя оно может задержать график миссии из- необходимости координации между несколькими системами.

by beardyw • 21 октября 2025 г. в 12:43 • 118 points

ОригиналHN

#artemis#blue-origin#dynetics#lunar-module#nasa#orion#sls#space-exploration#spacex

Комментарии (112)

  • Проект Artemis с самого начала был политически мотивирован, а не технически обоснован.
  • SLS и Orion продолжают получать финансирование, несмотря на то, что их технологическое устаревание уже очевидно.
  • SpaceX и другие компании, которые могли бы предложить более дешёвые и быстрые решения, исключены из конкуренции на рынке, где стоимость запуска ракеты варьируется от 10 до 20 тысяч долларов за килограмм полезной нагрузки.
  • Пока что нет никакой серьёзной альтернативы, и это оставляет только один игрока на поле.
  • Это ведёт к тому, что нет никакого стимула для конкуренции или инноваций, и в то же время, что влияние может быть только в одном направлении.

Tesla is heading into multi-billion-dollar iceberg of its own making (electrek.co) 💬 Длинная дискуссия

Tesla столкнулась с многомиллиардными проблемами из-за нереализованных обещаний о полностью автономном вождении. Компания в 2016 году заявила, что все автомобили с этого момента будут иметь "весь необходимый аппаратный комплекс для полностью автономного вождения", который станет доступен через будущие обновления. Однако это обещание оказалось невыполнимым - сначала Tesla использовала аппаратную платформу HW2, которая не поддерживала автономное вождение, затем перешла на HW3 (2019-2023), а в 2024 году представила HW4.

Изначально Илон Маск обещал задерживать обновления для новых автомобилей с HW4 на 6 месяцев, чтобы обеспечить обещанную функцию для тех, кто давно за нее заплатил, но эта стратегия просуществовала всего несколько месяцев. В результате все больше клиентов остаются без обещанных функций и требуют компенсаций, превращаясь в "айсберг" проблем, созданный самой Tesla.

by ndsipa_pomu • 21 октября 2025 г. в 11:39 • 199 points

ОригиналHN

#autonomous-driving#full-self-driving-fsd#hardware#tesla

Комментарии (201)

  • Tesla продолжает продавать опцию FSD, но не предлагает переноса лицензии на новую машину, что делает покупателей заложниками старой.
  • Покупатели, которые заплатили $15 000 за функцию, которую Tesla не может и не собирается поставить, теперь должны купить еще одну машину, чтобы получить то, что они уже оплатили.
  • Компания не предлагает никакого пути апгрейда существующих машин до HW4, и это оставляет владельцам только выбор между потерей $15 000 и покупкой новой машины.
  • В то же время, Tesla продолжает взимать $15 000 за FSD, хотя она не может быть использована на HW3, и не ясно, будет ли она когда-нибудь реализована.

60k kids have avoided peanut allergies due to 2015 advice, study finds (cbsnews.com) 🔥 Горячее 💬 Длинная дискуссия

Исследование показало, что около 60 000 детей избежали развития аллергии на арахис благодаря рекомендациям 2015 года, которые советовали вводить арахисовые продукты младенцам уже с 4-месячного возраста. Эта смена подхода перевернула медицинскую практику и привела к значительному снижению случаев аллергий у детей.

По данным, опубликованным в журнале Pediatrics, аллергии на арахис у детей в возрасте 0-3 лет снизились более чем на 27% после выдачи рекомендаций в 2015 году и более чем на 40% после их расширения в 2017 году. "Я могу прийти к вам сегодня и сказать, что сегодня меньше детей с пищевой аллергией, чем было бы без этих усилий общественного здравоохранения", - отметил д-р Дэвид Хилл, автор исследования.

Тем не менее общая распространенность пищевых аллергий в США продолжает расти - около 8% детей страдают от них, включая более 2% с аллергией на арахис. Эксперты подчеркивают важность дальнейшего повышения осведомленности и образования для усиления положительных эффектов.

by zdw • 21 октября 2025 г. в 03:53 • 315 points

ОригиналHN

Комментарии (283)

  • Исследование LEAP показало, что раннее введение арахиса снижает риск аллергии, и это уже повлияло на практику взросления.
  • Родители в США и ЕС всё ещё часто изолируют детей от аллергенов, в то время как в Израиле и других странах дети едят арахис с раннего возраста.
  • Появились продукты, которые реализуют эту стратегию, но они не везде доступны, и врачи не всегда их рекомендуют.
  • Сложность в том, что не все дети одинаково реагируют на арахис, и это может быть связано с генетикой и другими факторами.
  • В конечном счёте, важно то, что раннее введение аллергенов может снизить риск аллергии, но не всегда применимо и требует индивидуального подхода.