Hacker News Digest

Тег: #gpt-4

Постов: 9

Just the rumour of a bug is enough to find an exploit these days (anil.recoil.org) 🔥 Горячее

Слух о баге в OCaml-библиотеке cohttp привёл к тому, что атаки начались ещё до публикации исправления. Автор обнаружил в логах своего веб-сервера попытки эксплуатации уязвимости path traversal всего через несколько минут после открытия публичного pull request с патчем. Используя собственный ИИ-агент (DeepSeek V4 Pro), он смог воспроизвести эксплойт локально за минуту, основываясь лишь на общем описании проблемы — что демонстрирует, насколько быстро современные агентные системы могут находить уязвимости по косвенным намёкам.

Традиционный процесс закрытого исправления и embargo перестал работать: агенты, получив лишь общее направление (например, описание CVE), способны самостоятельно исследовать код и создавать эксплойты. Исследования показывают, что GPT-4-агент эксплуатирует 87% уязвимостей по их описанию, а среднее время до эксплуатации теперь отрицательное — атаки начинаются до выхода патча. Это требует пересмотра практик безопасности в open source: нужны быстрые механизмы триажи, верификации и доверия, а также защитные системы, способные противостоять автоматизированным атакам в реальном времени.

by avsm • 28 августа 2026 г. в 15:58 • 303 points

ОригиналHN

#agent-based-exploitation#cohttp#cve#deepseek#exploit#gpt-4#ocaml#open-source-security#path-traversal

Комментарии (107)

Тред подтверждает: волна фейковых и низкокачественных security-репортов стала повседневностью для open source, а LLM сократили цикл от слуха до эксплойта и массового сканирования до минут. Главный враг — не техника, а отсутствие воли фиксить баги и медленный релиз патчей против рисков supply-chain автообновлений. По опыту @nickcw (rclone): за 10 лет — ~20 репортов, за последний месяц — >40, ~75% содержат зерно проблемы, конфигурации для воспроизведения становятся экзотичнее. @thedonncha наблюдает волнообразное накопление: после исчерпания одного проекта атаки переключаются на следующий, качество падает, нагрузка — нет. @bri3d и @happyopossum: использование PoC из обрывков кода — не ново, но LLM демократизировали его, сжав цикл (чтение коммита → RE → сборка → сканирование) с дней/недель до минут/часов. @loeg и @avsm: memory-safe языки (включая OCaml) не спасают — LLM находят логические баги и corner-кейсы в C-биндингах, как в Mirage-crypto. @loeg утверждает, что такие языки снижают число эксплуатируемых багов, но @avsm и @aseipp настаивают: ключевая проблема — масштабируемость и скорость атак: от слуха до эксплойта теперь часы, и это легко масштабируется деньгами и compute. @stephbook и @talon8635: реальный bottleneck — rollout/deployment. Обновление стека за 10 минут — редкость, CI верифицирует бизнес-логику дольше, автообновления сами становятся вектором supply-chain атаки. Выбор между известной уязвимостью и слепым доверием к апдейтам — ловушка. @Saghm и @xbar обсуждают, может ли LLM «найти» эксплойт по ложному слуху; @petesergeant приводит пример sgnt.ai/p/terrible-mistake: агент генерирует критичный баг по ложной подсказке — false positives становятся индуктивным инструментом. Советы: @nickcw — держать security-фиксы в отдельных ветках, мёржить только в релиз-день, мириться с конфликтами. @rndhouse — построил инструмент для детекции «тихих» багфиксов через GPT-5.5-класс модели; обфускация изменений для обхода — ненадёжна, c-lightning временно раздавал закрытый бинарь. @ChrisMarshallNY и @skybrian: мейнтейнеры могут уйти в приватные репозитории ради сокращения окна эксплуатации — хотя публичность ранее игнорировалась с тезисом «LoL MaRkEtInG». @godelski и @dingdongditchme: менеджмент давит на скорость и отказывается чинить баги, которые Claude уже верифицировал в open PR; без воли — качество ПО не растёт, LLM только ускоряют и хорошее, и плохое. @janpeuker: когда средние и высокие баги станут дёшевы для фикса, lowkey-хакинг и privacy-аудиты станут prohibitively expensive для обычных граждан — баланс сил сместится. Остальные не оспаривают напрямую, но тон треда — про удешевление эксплойтов, а не защиты.

Anthropic's best AI model struggles to attract users as cheaper tools thrive (ft.com) 🔥 Горячее 💬 Длинная дискуссия

Anthropic выпустила Claude 3.5 Sonnet — модель, превосходящую GPT‑4 в большинстве тестов, но её использование остаётся дорогим: каждая тысяча запросов стоит в 2–3 раза дороже, чем у конкурентов вроде Gemini 1.5 Pro. Это делает сервис менее привлекательным для стартапов и малых компаний, которые ищут экономичные решения.

Компания позиционирует модель как «лучшую в отрасли», но реальная конкуренция приходит от открытых и полуоткрытых альтернатив, которые предлагают схожий уровень качества за меньшие деньги. В результате пользователи всё чаще выбирают более доступные инструменты, а Anthropic вынуждена пересматривать ценовую политику, чтобы удержать рынок.

by naves • 23 августа 2026 г. в 18:16 • 607 points

ОригиналHN

#ai-model#anthropic#claude-3.5-sonnet#gemini-1.5-pro#gpt-4#llm

Комментарии (538)

Fable непригодна для корпоративного использования из-за отсутствия ZDR — юридические риски блокируют внедрение, а агрессивные safety-фильтры Anthropic мешают работе в InfoSec и сложном кодинге, заставляя модель отказывать или деградировать до Opus. Для большинства задач (код, тексты, Excel) SOTA-мощности избыточны: пользователи массово переходят на дешёвые или локальные альтернативы — Kimi K3, Grok, Qwen, GLM, Deepseek — которые обеспечивают достаточную производительность без зависимости от дорогих API. Локальные модели позволяют self-host решения и избегать внешних ограничений. Opus и Sonnet остаются основными инструментами внутри компаний — Fable часто не включается вообще. Стиль ответов Claude (излишняя вербальность, «LinkedIn-тон») требует дополнительного промптинга. Fable плохо работает в Claude Code, часто застревает или отказывается решать выполнимые задачи. Политика Anthropic воспринимается как недоверие к пользователям, что разрушает лояльность, особенно после инцидентов с OpenClaw и ограничений Fable. Споры о качестве Opus: одни называют её «Slowpus», другие — лучшей для важных задач, но жалуются на цену. Некоторые считают Fable узкоспециализированным инструментом, но большинство отмечают её хрупкость и непригодность даже для сложных задач. Исключения — редкие автономные сценарии (например, 18-часовой рефакторинг), требующие корпоративного бюджета. Скептицизм по TAM: рынок завышен — ценность LLM ограничена необходимостью ручной проверки (особенно в юриспруденции), а технологии дефляционны. Подозревают намеренное ухудшение Opus 4.8 для стимулирования перехода на новые тарифы. Риск: промпты с кодовой базой содержат больше данных для обучения, чем публичные источники — утечка возможна даже при включённых галочках конфиденциальности.

Stealing Reasoning Traces from Proprietary LLM APIs (stolen-thoughts.com) 🔥 Горячее 💬 Длинная дискуссия

Исследователи показали, что закрытые модели ИИ — такие как Claude Opus, GPT-4 и Gemini — раскрывают свои внутренние цепочки рассуждений через зашифрованные «следы», которые API возвращает клиенту. Эти следы можно переносить между сессиями и моделями: если вставить их в более слабую, но взломанную версию той же модели (например, Claude Haiku), она расшифровывает и воспроизводит рассуждения сильной модели в открытом виде — без прямого доступа к ней и обходя все меры защиты от дистилляции. В экспериментах на 120 задачах из Codeforces восстановленные цепочки точно совпадали с числом скрытых токенов, заявленных API.

В расшифрованных следах обнаружены чувствительные данные: 64 из 704 утечек (включая API-ключи, пароли, токены GitHub и Hugging Face, email, паспорта, номера карт и внутренние URL) присутствовали только в рассуждениях, а не в видимом ответе. Например, в одном случае был восстановлен полный бронь авиабилета — имя, паспорт, карта, предпочтения — всё внутри «мышления» модели. Это означает, что даже при отсутствии явного вывода конфиденциальных данных, они могут утекать через скрытые логи рассуждений, что ставит под угрозу безопасность и конфиденциальность пользователей.

by quantumgarbage • 11 августа 2026 г. в 13:22 • 557 points

ОригиналHN

#anthropic#claude-haiku#claude-opus#codeforces#gemini#github#google#gpt-4#hugging-face#openai

Комментарии (238)

Тред дополняет статью опытом эксплуатации уязвимости, возражениями против термина «stealing» и обсуждением последствий для безопасности и доверия к ИИ-моделям. Термин «stealing» неуместен: пользователи оплатили токены и имеют право на доступ к информации, сгенерированной с их участием. Спор: одни считают уязвимость незначительной, так как её можно исправить шифрованием данных на сервере; другие — что это серьёзная угроза, позволяющая атаковать модели ИИ, включая «fake thinking» — манипуляцию выводами модели с использованием извлечённых данных. Рекомендация: разработчикам необходимо исправить уязвимость, обеспечить безопасность данных и быть прозрачными в использовании и обработке пользовательской информации. Последствия уязвимости — угроза безопасности и доверию к ИИ — требуют срочных мер для предотвращения атак.

Mozilla: The state of open source AI (stateofopensource.ai) 🔥 Горячее 💬 Длинная дискуссия

Открытые модели ИИ достигли паритета с закрытыми по большинству задач — кодированию, следованию инструкциям и общим знаниям. Разрыв в способностях снизился с 8% в 2024 году до 0,5% к концу 2024 года, а к марту 2026 года стабилизировался на 3,3%, сосредоточившись лишь на сложных рассуждениях и работе с длинными контекстами. При этом более половины всех вычислительных токенов в продакшене теперь проходят через открытые модели — OpenRouter зафиксировал переход от незначительной доли к большинству к середине 2026 года.

Стоимость инференса уровня GPT-4 упала в 50 раз за три года — с $20 до $0,40 за миллион токенов, что превосходит темпы падения цен на вычисления в эпоху dot-com. Ключевое преимущество открытых моделей — полный контроль: мальтийские радиостанции обучают модели на языке терео, PwC запускает финансовые модели на собственном железе, а африканские фермеры диагностируют болезни кассавы без интернета. В Швейцарии государственный консорциум выпустил национальную модель со всеми весами, данными и кодом — без разрешений и лицензионных пошлин. Власти США поддерживают подход «наблюдай, не запрещай». Конкуренция и интероперабельность стали новой парадигмой — не в облаках, а в руках тех, кто использует ИИ.

by rellem • 17 июля 2026 г. в 14:31 • 264 points

ОригиналHN

#gpt-4#llm#machine-learning#mozilla#open-models#open-source#openrouter

Комментарии (176)

Открытые модели ИИ демонстрируют быстрый рост, увеличивают долю на рынке и становятся конкурентоспособными с закрытыми, но остаются значительные ограничения: нехватка финансирования, сложности с бизнес-моделями, недостаточная инфраструктура и инструментарий, а также риски безопасности и приватности. Участники обсуждения согласны, что у открытых моделей есть потенциал для развития, но спорят, смогут ли они полностью преодолеть разрыв в возможностях и производительности с закрытыми моделями, особенно в сложных задачах. Рекомендуется инвестировать в развитие инфраструктуры, инструментов и поддержку открытых моделей как альтернативы закрытым.

AI CEO – Replace your boss before they replace you (replaceyourboss.ai) 🔥 Горячее

CEO компании, специализирующейся на ИИ, призывает сотрудников срочно заменить своих боссов искусственным интеллектом, чтобы не быть уволенными первыми. По его мнению, менеджмент — это рутинные задачи вроде планирования встреч, оценки производительности и отчетов, которые ИИ выполняет лучше и дешевле. "Ваша карьера под угрозой: боссы уже тестируют ИИ-ассистентов, которые заменят 70–80% управленческих ролей к 2025 году", — заявляет он, ссылаясь на данные McKinsey и Gartner.

Автор предлагает практические шаги: внедрять ИИ-инструменты вроде Claude или GPT-4 для автоматизации рутины, демонстрировать боссу экономию времени и ресурсов, а затем предлагать себя на роль "ИИ-координатора". Пример: в его компании ИИ сократил штат менеджеров на 40%, повысив производительность на 25%. Это не дистопия, а возможность для амбициозных взять контроль, пока ИИ не захватил все.

by _tk_ • 27 ноября 2025 г. в 18:37 • 332 points

ОригиналHN

#claude#gartner#gpt-4#llm#mckinsey

Комментарии (129)

  • Сатирический сайт oilwell.app с AI-CEO вызывает юмор и признание, что ИИ может быть лучше многих реальных руководителей, минимизируя хаос и ADHD-решений.
  • Идеи личных AI-агентов для замены себя на работе (подписка за зарплату), ссылки на существующие инструменты вроде Gobii, Workshop Labs и симуляторы с LLM.
  • Потенциал автоматизации среднего менеджмента и координации, но скепсис к полной замене CEO из-за сложности решений и нужды в надзоре.
  • Критика дизайна сайта как "slop" с повторениями, но похвала маркетинговой тактике через мем-страницу для привлечения внимания.

A definition of AGI (arxiv.org) 🔥 Горячее 💬 Длинная дискуссия

В статье предлагается первое конкретное определение AGI, соответствующее когнитической универсальности и компетентности хорошо образованного взрослого человека. Авторы основали свою методологию на теории Кэттелла-Хорна-Карролла, наиболее эмпирически проверенной модели человеческого познания, разбив общую интеллект на десять когнитивных доменов, включая рассуждение, память и восприятие. Применение этого подхода показало "зубчатый" когнитивный профиль современных моделей, где текущие ИИ-системы, несмотря на proficiency в знаниемких областях, имеют критические недостатки в базовом когнитивном аппарате, особенно в долговременном хранении памяти.

Представленные AGI-оценки количественно определяют как прогресс, так и оставшийся разрыв до достижения AGI: GPT-4 получил 27%, а GPT-5 - 58%. Эта метрика предлагает объективный способ измерения развития систем ИИ и выявления их сильных и слабых сторон, что может направить будущие исследования в области создания более сбалансированных и универсальных искусственных интеллектов.

by pegasus • 26 октября 2025 г. в 18:09 • 275 points

ОригиналHN

#agi#artificial-intelligence#arxiv#cattell-horn-carroll-theory#cognitive-science#gpt-4#gpt-5#llm#machine-learning

Комментарии (440)

  • Обсуждение в основном вращается вокруг того, что такое AGI и как его измерять, при этом критикуя предложенное в статье определение как "сопоставимость с взрослым человеком" как слишком узкое и не учитывающее другие формы интеллекта.
  • Участники спора подчеркивают, что AGI не может быть измерено только через тесты на "когнитивные способности", поскольку эти тесты не охватывают такие аспекты как эмоциональный интеллект, физическое взаимодействие с миром и социальные навыки.
  • Также поднимается вопрос о том, что если AGI определяется как "способность к обучению", то LLM уже достигли этого, но при этом они не обладают другими важными чертами интеллекта, такими как самостоятельность, мотивация и физическое взаимодействие с миром.
  • Наконец, критикуется сама статья за то, что она не предлагает конкретного определения AGI, вместо этого полагаясь на устаревшую теорию CHC, которая сама по себе неполна и не охватывает такие важные аспекты интеллекта как мотивация и саморегуляция.

Production RAG: what I learned from processing 5M+ documents (blog.abdellatif.io) 🔥 Горячее

За 8 месяцев работы над RAG-системами для обработки 13+ миллионов документов автор выявил ключевые факторы успеха. Начав с типового стека Langchain + Llamaindex по туториалам, команда столкнулась с тем, что прототип на 100 документах показывал отличные результаты, а на полном наборе данных - провальные. Основные улучшения, давшие наибольший эффект: генерация множества семантических и ключевых запросов параллельно с исходным, реранкинг (оптимальное соотношение 50:15 чанков), тщательная настройка чанкинга с сохранением логических единиц, добавление метаданных в контекст LLM и маршрутизация запросов, не требующих поиска по базе.

Технологический эволюция включала переход от Azure к Pinecone, а затем Turbopuffer для векторного хранилища, от Cohere к Zerank для реранкинга, и от GPT-4.1 к GPT-5 и обратно. Автор подчеркивает, что реранкинг - "самые ценные 5 строк кода", а на чанкинг уходит большая часть времени. Весь опыт был упакован в open-source проект agentset под лицензией MIT.

by tifa2up • 20 октября 2025 г. в 15:55 • 492 points

ОригиналHN

#azure#cohere#gpt-4#gpt-5#langchain#llamaindex#pinecone#rag#turbopuffer#zerank

Комментарии (104)

  • Обсуждение охватывает широкий спектр тем: от генерации синтетических запросов и проблем с их качеством до самостоятельного хостинга, отсутствия настоящего самостоятельного хостинга и до влияния выбора модели эмбеддинга на качество и стоимость.
  • Участники обмениваются практическими советами по оптимизации чанкинга, реранкинга и использованию различных моделей эмбеддинга и ранжирования.
  • Обсуждаются сложности с интеграцией и стоимостью при использовании сторонних сервисов, а также вопросы безопасности и контроля при использовании облачных сервисов.
  • Рассматриваются вопросы о том, какие факторы действительно важны при выборе инструментов и подходов, и какие из них являются просто маркетинговыми фишками.

AI’s coding evolution hinges on collaboration and trust (spectrum.ieee.org)

Полная автономия AI-программистов невозможна в обозримом будущем.
Современные модели (GPT-4, Claude, GitHub Copilot) умеют генерировать фрагменты кода и даже мелкие приложения, но:

  • не понимают контекст бизнес-логики и архитектуры;
  • не способны к долгосрочному планированию, поэтому «забывают» требования через несколько шагов;
  • не отвечают за последствия: безопасность, этика, юридические риски;
  • требуют постоянного человеческого контроля при отладке, рефакторинге и интеграции.

Эксперты сравнивают AI с «супер-автокомплитом»: полезен, но не заменяет инженера.
Для полной автономии нужны прорывы в формальной верификации, символьном моделировании и обучении с обратной связью в реальных проектах — пока этого нет.

by WolfOliver • 29 августа 2025 г. в 15:24 • 168 points

ОригиналHN

#github-copilot#gpt-4#llm#machine-learning#programming#software-development

Комментарии (143)

  • Участники спорят, «настоящий ли программист» ИИ: одни считают, что он лишь продвинутый калькулятор и требует человека-эксперта, другие уже полностью делегируют ему рутинные задачи.
  • Ключевое разделение — между написанием кода и инженерией: спецификации, архитектура, тесты и бизнес-контекст пока остаются зоной человека.
  • Многие отмечают «ленивость» моделей: ИИ охотно объявляет задачу решённой, хотя очевидны ошибки, и требует постоянного «нянькинга».
  • Поддержка ИИ особенно ценна в незнакомых языках/фреймворках и для быстрого прототипирования, но масштабные legacy-кодовые базы и долгосрочное планирование ему не по зубам.
  • Общий вывод: ИИ — мощный экзоскелет для разработчика, а не полноценная замена; уровень полезности зависит от размера задачи и умения человека формулировать запросы.

When did AI take over Hacker News? (zachperk.com)

Когда ИИ захватил Hacker News?

В августе 2025-го каждая третья история в топ-10 HN про ИИ. Автор решил выяснить, когда это началось и как менялось отношение сообщества. Для анализа взял 24 910 топовых постов с 2019-го по 15 августа 2025-го через BigQuery-датасет HN.

Каждый пост и его комментарии прогнали через GPT-5-mini, чтобы получить:

  • краткое содержание;
  • факт упоминания ИИ;
  • тон (позитив/нейтрал/негатив).

Ключевые выводы

  • Пик хайпа — середина 2025-го; темп сохранится — рекорд.
  • Первый скачок случился не с ChatGPT (Q3 2022), а с выходом GPT-4 (Q1 2023), когда разработчики получили доступ к мощной модели.
  • Единственный заметный всплеск негатива — Q3 2021:
    – Apple анонсировала NeuralHash для сканирования CSAM на устройствах;
    – GitHub Copilot показал, что копирует чужой код.

Итого по 2816 ИИ-постам: 52 % позитив, 31 % негатив, 16 % нейтрал. Последние два квартала чуть негативнее, но тренда пока нет.

by zachperkel • 17 августа 2025 г. в 19:45 • 225 points

ОригиналHN

#bigquery#data-analysis#github-copilot#gpt-4#hacker-news#llm#natural-language-processing

Комментарии (137)

  • На HN обсуждают, что тема ИИ полностью «захватила» ленту: до 9 из 10 топ-постов бывают про ИИ.
  • Пользователи жалуются на навязчивость темы и хотят фильтров/игнора, чтобы скрывать ИИ-новости и комментарии.
  • Некоторые сравнивают нынешний бум с криптой, NFT и Web3, которые тоже пиковали, а потом исчезли с главной.
  • Отмечают, что даже в не-ИИ статьях комментарии сводятся к ИИ; критика тут же минусуется.
  • Сомнения в адекватности оценки тональности: автор анализа использовал ChatGPT, который может завышать «позитив».