Just the rumour of a bug is enough to find an exploit these days 🔥 Горячее
Слух о баге в OCaml-библиотеке cohttp привёл к тому, что атаки начались ещё до публикации исправления. Автор обнаружил в логах своего веб-сервера попытки эксплуатации уязвимости path traversal всего через несколько минут после открытия публичного pull request с патчем. Используя собственный ИИ-агент (DeepSeek V4 Pro), он смог воспроизвести эксплойт локально за минуту, основываясь лишь на общем описании проблемы — что демонстрирует, насколько быстро современные агентные системы могут находить уязвимости по косвенным намёкам.
Традиционный процесс закрытого исправления и embargo перестал работать: агенты, получив лишь общее направление (например, описание CVE), способны самостоятельно исследовать код и создавать эксплойты. Исследования показывают, что GPT-4-агент эксплуатирует 87% уязвимостей по их описанию, а среднее время до эксплуатации теперь отрицательное — атаки начинаются до выхода патча. Это требует пересмотра практик безопасности в open source: нужны быстрые механизмы триажи, верификации и доверия, а также защитные системы, способные противостоять автоматизированным атакам в реальном времени.
Комментарии (107)
Тред подтверждает: волна фейковых и низкокачественных security-репортов стала повседневностью для open source, а LLM сократили цикл от слуха до эксплойта и массового сканирования до минут. Главный враг — не техника, а отсутствие воли фиксить баги и медленный релиз патчей против рисков supply-chain автообновлений. По опыту @nickcw (rclone): за 10 лет — ~20 репортов, за последний месяц — >40, ~75% содержат зерно проблемы, конфигурации для воспроизведения становятся экзотичнее. @thedonncha наблюдает волнообразное накопление: после исчерпания одного проекта атаки переключаются на следующий, качество падает, нагрузка — нет. @bri3d и @happyopossum: использование PoC из обрывков кода — не ново, но LLM демократизировали его, сжав цикл (чтение коммита → RE → сборка → сканирование) с дней/недель до минут/часов. @loeg и @avsm: memory-safe языки (включая OCaml) не спасают — LLM находят логические баги и corner-кейсы в C-биндингах, как в Mirage-crypto. @loeg утверждает, что такие языки снижают число эксплуатируемых багов, но @avsm и @aseipp настаивают: ключевая проблема — масштабируемость и скорость атак: от слуха до эксплойта теперь часы, и это легко масштабируется деньгами и compute. @stephbook и @talon8635: реальный bottleneck — rollout/deployment. Обновление стека за 10 минут — редкость, CI верифицирует бизнес-логику дольше, автообновления сами становятся вектором supply-chain атаки. Выбор между известной уязвимостью и слепым доверием к апдейтам — ловушка. @Saghm и @xbar обсуждают, может ли LLM «найти» эксплойт по ложному слуху; @petesergeant приводит пример sgnt.ai/p/terrible-mistake: агент генерирует критичный баг по ложной подсказке — false positives становятся индуктивным инструментом. Советы: @nickcw — держать security-фиксы в отдельных ветках, мёржить только в релиз-день, мириться с конфликтами. @rndhouse — построил инструмент для детекции «тихих» багфиксов через GPT-5.5-класс модели; обфускация изменений для обхода — ненадёжна, c-lightning временно раздавал закрытый бинарь. @ChrisMarshallNY и @skybrian: мейнтейнеры могут уйти в приватные репозитории ради сокращения окна эксплуатации — хотя публичность ранее игнорировалась с тезисом «LoL MaRkEtInG». @godelski и @dingdongditchme: менеджмент давит на скорость и отказывается чинить баги, которые Claude уже верифицировал в open PR; без воли — качество ПО не растёт, LLM только ускоряют и хорошее, и плохое. @janpeuker: когда средние и высокие баги станут дёшевы для фикса, lowkey-хакинг и privacy-аудиты станут prohibitively expensive для обычных граждан — баланс сил сместится. Остальные не оспаривают напрямую, но тон треда — про удешевление эксплойтов, а не защиты.
Anthropic's best AI model struggles to attract users as cheaper tools thrive 🔥 Горячее 💬 Длинная дискуссия
Anthropic выпустила Claude 3.5 Sonnet — модель, превосходящую GPT‑4 в большинстве тестов, но её использование остаётся дорогим: каждая тысяча запросов стоит в 2–3 раза дороже, чем у конкурентов вроде Gemini 1.5 Pro. Это делает сервис менее привлекательным для стартапов и малых компаний, которые ищут экономичные решения.
Компания позиционирует модель как «лучшую в отрасли», но реальная конкуренция приходит от открытых и полуоткрытых альтернатив, которые предлагают схожий уровень качества за меньшие деньги. В результате пользователи всё чаще выбирают более доступные инструменты, а Anthropic вынуждена пересматривать ценовую политику, чтобы удержать рынок.
Комментарии (538)
Fable непригодна для корпоративного использования из-за отсутствия ZDR — юридические риски блокируют внедрение, а агрессивные safety-фильтры Anthropic мешают работе в InfoSec и сложном кодинге, заставляя модель отказывать или деградировать до Opus. Для большинства задач (код, тексты, Excel) SOTA-мощности избыточны: пользователи массово переходят на дешёвые или локальные альтернативы — Kimi K3, Grok, Qwen, GLM, Deepseek — которые обеспечивают достаточную производительность без зависимости от дорогих API. Локальные модели позволяют self-host решения и избегать внешних ограничений. Opus и Sonnet остаются основными инструментами внутри компаний — Fable часто не включается вообще. Стиль ответов Claude (излишняя вербальность, «LinkedIn-тон») требует дополнительного промптинга. Fable плохо работает в Claude Code, часто застревает или отказывается решать выполнимые задачи. Политика Anthropic воспринимается как недоверие к пользователям, что разрушает лояльность, особенно после инцидентов с OpenClaw и ограничений Fable. Споры о качестве Opus: одни называют её «Slowpus», другие — лучшей для важных задач, но жалуются на цену. Некоторые считают Fable узкоспециализированным инструментом, но большинство отмечают её хрупкость и непригодность даже для сложных задач. Исключения — редкие автономные сценарии (например, 18-часовой рефакторинг), требующие корпоративного бюджета. Скептицизм по TAM: рынок завышен — ценность LLM ограничена необходимостью ручной проверки (особенно в юриспруденции), а технологии дефляционны. Подозревают намеренное ухудшение Opus 4.8 для стимулирования перехода на новые тарифы. Риск: промпты с кодовой базой содержат больше данных для обучения, чем публичные источники — утечка возможна даже при включённых галочках конфиденциальности.
Stealing Reasoning Traces from Proprietary LLM APIs 🔥 Горячее 💬 Длинная дискуссия
Исследователи показали, что закрытые модели ИИ — такие как Claude Opus, GPT-4 и Gemini — раскрывают свои внутренние цепочки рассуждений через зашифрованные «следы», которые API возвращает клиенту. Эти следы можно переносить между сессиями и моделями: если вставить их в более слабую, но взломанную версию той же модели (например, Claude Haiku), она расшифровывает и воспроизводит рассуждения сильной модели в открытом виде — без прямого доступа к ней и обходя все меры защиты от дистилляции. В экспериментах на 120 задачах из Codeforces восстановленные цепочки точно совпадали с числом скрытых токенов, заявленных API.
В расшифрованных следах обнаружены чувствительные данные: 64 из 704 утечек (включая API-ключи, пароли, токены GitHub и Hugging Face, email, паспорта, номера карт и внутренние URL) присутствовали только в рассуждениях, а не в видимом ответе. Например, в одном случае был восстановлен полный бронь авиабилета — имя, паспорт, карта, предпочтения — всё внутри «мышления» модели. Это означает, что даже при отсутствии явного вывода конфиденциальных данных, они могут утекать через скрытые логи рассуждений, что ставит под угрозу безопасность и конфиденциальность пользователей.
Комментарии (238)
Тред дополняет статью опытом эксплуатации уязвимости, возражениями против термина «stealing» и обсуждением последствий для безопасности и доверия к ИИ-моделям. Термин «stealing» неуместен: пользователи оплатили токены и имеют право на доступ к информации, сгенерированной с их участием. Спор: одни считают уязвимость незначительной, так как её можно исправить шифрованием данных на сервере; другие — что это серьёзная угроза, позволяющая атаковать модели ИИ, включая «fake thinking» — манипуляцию выводами модели с использованием извлечённых данных. Рекомендация: разработчикам необходимо исправить уязвимость, обеспечить безопасность данных и быть прозрачными в использовании и обработке пользовательской информации. Последствия уязвимости — угроза безопасности и доверию к ИИ — требуют срочных мер для предотвращения атак.
Mozilla: The state of open source AI 🔥 Горячее 💬 Длинная дискуссия
Открытые модели ИИ достигли паритета с закрытыми по большинству задач — кодированию, следованию инструкциям и общим знаниям. Разрыв в способностях снизился с 8% в 2024 году до 0,5% к концу 2024 года, а к марту 2026 года стабилизировался на 3,3%, сосредоточившись лишь на сложных рассуждениях и работе с длинными контекстами. При этом более половины всех вычислительных токенов в продакшене теперь проходят через открытые модели — OpenRouter зафиксировал переход от незначительной доли к большинству к середине 2026 года.
Стоимость инференса уровня GPT-4 упала в 50 раз за три года — с $20 до $0,40 за миллион токенов, что превосходит темпы падения цен на вычисления в эпоху dot-com. Ключевое преимущество открытых моделей — полный контроль: мальтийские радиостанции обучают модели на языке терео, PwC запускает финансовые модели на собственном железе, а африканские фермеры диагностируют болезни кассавы без интернета. В Швейцарии государственный консорциум выпустил национальную модель со всеми весами, данными и кодом — без разрешений и лицензионных пошлин. Власти США поддерживают подход «наблюдай, не запрещай». Конкуренция и интероперабельность стали новой парадигмой — не в облаках, а в руках тех, кто использует ИИ.
Комментарии (176)
Открытые модели ИИ демонстрируют быстрый рост, увеличивают долю на рынке и становятся конкурентоспособными с закрытыми, но остаются значительные ограничения: нехватка финансирования, сложности с бизнес-моделями, недостаточная инфраструктура и инструментарий, а также риски безопасности и приватности. Участники обсуждения согласны, что у открытых моделей есть потенциал для развития, но спорят, смогут ли они полностью преодолеть разрыв в возможностях и производительности с закрытыми моделями, особенно в сложных задачах. Рекомендуется инвестировать в развитие инфраструктуры, инструментов и поддержку открытых моделей как альтернативы закрытым.
AI CEO – Replace your boss before they replace you 🔥 Горячее
CEO компании, специализирующейся на ИИ, призывает сотрудников срочно заменить своих боссов искусственным интеллектом, чтобы не быть уволенными первыми. По его мнению, менеджмент — это рутинные задачи вроде планирования встреч, оценки производительности и отчетов, которые ИИ выполняет лучше и дешевле. "Ваша карьера под угрозой: боссы уже тестируют ИИ-ассистентов, которые заменят 70–80% управленческих ролей к 2025 году", — заявляет он, ссылаясь на данные McKinsey и Gartner.
Автор предлагает практические шаги: внедрять ИИ-инструменты вроде Claude или GPT-4 для автоматизации рутины, демонстрировать боссу экономию времени и ресурсов, а затем предлагать себя на роль "ИИ-координатора". Пример: в его компании ИИ сократил штат менеджеров на 40%, повысив производительность на 25%. Это не дистопия, а возможность для амбициозных взять контроль, пока ИИ не захватил все.
Комментарии (129)
- Сатирический сайт oilwell.app с AI-CEO вызывает юмор и признание, что ИИ может быть лучше многих реальных руководителей, минимизируя хаос и ADHD-решений.
- Идеи личных AI-агентов для замены себя на работе (подписка за зарплату), ссылки на существующие инструменты вроде Gobii, Workshop Labs и симуляторы с LLM.
- Потенциал автоматизации среднего менеджмента и координации, но скепсис к полной замене CEO из-за сложности решений и нужды в надзоре.
- Критика дизайна сайта как "slop" с повторениями, но похвала маркетинговой тактике через мем-страницу для привлечения внимания.
A definition of AGI 🔥 Горячее 💬 Длинная дискуссия
В статье предлагается первое конкретное определение AGI, соответствующее когнитической универсальности и компетентности хорошо образованного взрослого человека. Авторы основали свою методологию на теории Кэттелла-Хорна-Карролла, наиболее эмпирически проверенной модели человеческого познания, разбив общую интеллект на десять когнитивных доменов, включая рассуждение, память и восприятие. Применение этого подхода показало "зубчатый" когнитивный профиль современных моделей, где текущие ИИ-системы, несмотря на proficiency в знаниемких областях, имеют критические недостатки в базовом когнитивном аппарате, особенно в долговременном хранении памяти.
Представленные AGI-оценки количественно определяют как прогресс, так и оставшийся разрыв до достижения AGI: GPT-4 получил 27%, а GPT-5 - 58%. Эта метрика предлагает объективный способ измерения развития систем ИИ и выявления их сильных и слабых сторон, что может направить будущие исследования в области создания более сбалансированных и универсальных искусственных интеллектов.
Комментарии (440)
- Обсуждение в основном вращается вокруг того, что такое AGI и как его измерять, при этом критикуя предложенное в статье определение как "сопоставимость с взрослым человеком" как слишком узкое и не учитывающее другие формы интеллекта.
- Участники спора подчеркивают, что AGI не может быть измерено только через тесты на "когнитивные способности", поскольку эти тесты не охватывают такие аспекты как эмоциональный интеллект, физическое взаимодействие с миром и социальные навыки.
- Также поднимается вопрос о том, что если AGI определяется как "способность к обучению", то LLM уже достигли этого, но при этом они не обладают другими важными чертами интеллекта, такими как самостоятельность, мотивация и физическое взаимодействие с миром.
- Наконец, критикуется сама статья за то, что она не предлагает конкретного определения AGI, вместо этого полагаясь на устаревшую теорию CHC, которая сама по себе неполна и не охватывает такие важные аспекты интеллекта как мотивация и саморегуляция.
Production RAG: what I learned from processing 5M+ documents 🔥 Горячее
За 8 месяцев работы над RAG-системами для обработки 13+ миллионов документов автор выявил ключевые факторы успеха. Начав с типового стека Langchain + Llamaindex по туториалам, команда столкнулась с тем, что прототип на 100 документах показывал отличные результаты, а на полном наборе данных - провальные. Основные улучшения, давшие наибольший эффект: генерация множества семантических и ключевых запросов параллельно с исходным, реранкинг (оптимальное соотношение 50:15 чанков), тщательная настройка чанкинга с сохранением логических единиц, добавление метаданных в контекст LLM и маршрутизация запросов, не требующих поиска по базе.
Технологический эволюция включала переход от Azure к Pinecone, а затем Turbopuffer для векторного хранилища, от Cohere к Zerank для реранкинга, и от GPT-4.1 к GPT-5 и обратно. Автор подчеркивает, что реранкинг - "самые ценные 5 строк кода", а на чанкинг уходит большая часть времени. Весь опыт был упакован в open-source проект agentset под лицензией MIT.
Комментарии (104)
- Обсуждение охватывает широкий спектр тем: от генерации синтетических запросов и проблем с их качеством до самостоятельного хостинга, отсутствия настоящего самостоятельного хостинга и до влияния выбора модели эмбеддинга на качество и стоимость.
- Участники обмениваются практическими советами по оптимизации чанкинга, реранкинга и использованию различных моделей эмбеддинга и ранжирования.
- Обсуждаются сложности с интеграцией и стоимостью при использовании сторонних сервисов, а также вопросы безопасности и контроля при использовании облачных сервисов.
- Рассматриваются вопросы о том, какие факторы действительно важны при выборе инструментов и подходов, и какие из них являются просто маркетинговыми фишками.
AI’s coding evolution hinges on collaboration and trust
Полная автономия AI-программистов невозможна в обозримом будущем.
Современные модели (GPT-4, Claude, GitHub Copilot) умеют генерировать фрагменты кода и даже мелкие приложения, но:
- не понимают контекст бизнес-логики и архитектуры;
- не способны к долгосрочному планированию, поэтому «забывают» требования через несколько шагов;
- не отвечают за последствия: безопасность, этика, юридические риски;
- требуют постоянного человеческого контроля при отладке, рефакторинге и интеграции.
Эксперты сравнивают AI с «супер-автокомплитом»: полезен, но не заменяет инженера.
Для полной автономии нужны прорывы в формальной верификации, символьном моделировании и обучении с обратной связью в реальных проектах — пока этого нет.
Комментарии (143)
- Участники спорят, «настоящий ли программист» ИИ: одни считают, что он лишь продвинутый калькулятор и требует человека-эксперта, другие уже полностью делегируют ему рутинные задачи.
- Ключевое разделение — между написанием кода и инженерией: спецификации, архитектура, тесты и бизнес-контекст пока остаются зоной человека.
- Многие отмечают «ленивость» моделей: ИИ охотно объявляет задачу решённой, хотя очевидны ошибки, и требует постоянного «нянькинга».
- Поддержка ИИ особенно ценна в незнакомых языках/фреймворках и для быстрого прототипирования, но масштабные legacy-кодовые базы и долгосрочное планирование ему не по зубам.
- Общий вывод: ИИ — мощный экзоскелет для разработчика, а не полноценная замена; уровень полезности зависит от размера задачи и умения человека формулировать запросы.
When did AI take over Hacker News?
Когда ИИ захватил Hacker News?
В августе 2025-го каждая третья история в топ-10 HN про ИИ. Автор решил выяснить, когда это началось и как менялось отношение сообщества. Для анализа взял 24 910 топовых постов с 2019-го по 15 августа 2025-го через BigQuery-датасет HN.
Каждый пост и его комментарии прогнали через GPT-5-mini, чтобы получить:
- краткое содержание;
- факт упоминания ИИ;
- тон (позитив/нейтрал/негатив).
Ключевые выводы
- Пик хайпа — середина 2025-го; темп сохранится — рекорд.
- Первый скачок случился не с ChatGPT (Q3 2022), а с выходом GPT-4 (Q1 2023), когда разработчики получили доступ к мощной модели.
- Единственный заметный всплеск негатива — Q3 2021:
– Apple анонсировала NeuralHash для сканирования CSAM на устройствах;
– GitHub Copilot показал, что копирует чужой код.
Итого по 2816 ИИ-постам: 52 % позитив, 31 % негатив, 16 % нейтрал. Последние два квартала чуть негативнее, но тренда пока нет.
Комментарии (137)
- На HN обсуждают, что тема ИИ полностью «захватила» ленту: до 9 из 10 топ-постов бывают про ИИ.
- Пользователи жалуются на навязчивость темы и хотят фильтров/игнора, чтобы скрывать ИИ-новости и комментарии.
- Некоторые сравнивают нынешний бум с криптой, NFT и Web3, которые тоже пиковали, а потом исчезли с главной.
- Отмечают, что даже в не-ИИ статьях комментарии сводятся к ИИ; критика тут же минусуется.
- Сомнения в адекватности оценки тональности: автор анализа использовал ChatGPT, который может завышать «позитив».