Hacker News Digest

Тег: #gemini

Постов: 29

Gemini 3.8 Flash and 3.8 Flash Cyber (blog.google) 🔥 Горячее 💬 Длинная дискуссия

Gemini 3.8 Flash — это обновлённая версия модели из семейства Gemini 3, построенная на базе Gemini 3.7 Flash и ориентированная на улучшение производительности в задачах программирования и агентных рабочих процессов. Она поддерживает настраиваемые уровни усилий для балансировки качества, стоимости и задержки, принимает текст, изображения, аудио и видео с контекстным окном до 1 млн токенов и генерирует текстовый вывод до 64K токенов. Архитектура, данные обучения и аппаратная реализация наследуются от Gemini 3.7 Flash, что обеспечивает преемственность и упрощает интеграцию.

Оценка модели проводилась по широкому спектру бенчмарков: программирование, знаниевая работа, мультимодальность, длинный контекст, использование компьютера и научные рассуждения. По результатам безопасности, включая ручное красное teaming и оценки по Frontier Safety Framework, Gemini 3.8 Flash показала схожие или улучшенные показатели по сравнению с предшественницей, не достигла никаких отслеживаемых или критических уровней возможностей и не выявила существенных новых рисков. Ручное моделирование подтвердило, что большинство срабатываний фильтров были ложными срабатываниями или не представляли серьёзной угрозы, а защита детей соответствует обязательствам Google. Модель подходит для разработчиков и предприятий, стремящихся к масштабируемому и экономичному использованию ИИ.

by bratao • 02 сентября 2026 г. в 15:12 • 1043 points

ОригиналHN

#benchmark#frontier-safety-framework#gemini#google#llm#model#multimodal#programming#safety

Комментарии (581)

**Gemini 3.8 Flash: преимущества** - Улучшение над 3.7 Flash по скорости, стоимости и мультимодальности; силён в кодировании, анализе медиа и агентных задачах. - Низкая стоимость (1.8 цента за сложный HTML/JS за 13 секунд) делает его идеальным для повторяющихся проверяемых задач. - Мультимодальность (аудио, видео, изображения) и контекст до 1 млн токенов превосходят OpenAI и Anthropic, ограниченных изображениями. - На бенчмарках (Artificial Analysis, Redactle) достигает уровня Opus 5 при эффективности «Flash»-версии. - Стал доминирующим выбором для клиентских рабочих процессов, вытесняя другие модели. - Лучше различает экзотические фрукты и подлинники артефактов, но слаб в идентификации нишевых публичных фигур. - Превосходит Claude в письменной речи, особенно в структурированных аргументациях (например, эссе типа гаокао). - Интеграция с GCP делает его предпочтительным для корпоративных решений, включая хостинг в Европе. **Ограничения и споры** - Регрессия на низком уровне усилий (thinking level low) по сравнению с 3.7 Flash, несмотря на улучшения на среднем и высоком. - Часть пользователей не видит улучшения латентности относительно 3.5 Flash в реальных сценариях, что ставит под сомнение маркетинговые заявления. - Может генерировать «безопасный», но нерабочий код, поэтому для критичных задач некоторые разработчики предпочитают Opus 4.6. - База знаний не обновлена после января 2025 года, что ограничивает применение в быстроменяющихся областях. - Некоторые пользователи считают, что Google занижает позиционирование Flash, чтобы скрыть отсутствие обновлений Pro-версий. - Недоступен в веб-интерфейсе Gemini даже спустя несколько дней после анонса, что вызывает раздражение у платных пользователей. **Рекомендации** - Для высокочастотных задач (сканирование коммитов на совместимость плагинов) скорость и низкая стоимость оправдывают возможные ошибки благодаря лёгкости перезапуска. - При выборе для агентных задач стоит тестировать наряду с Deepseek v4 Flash — последний может быть конкурентоспособнее в текстовых сценариях.

Check if a file was made with Claude (claude.com)

Claude добавляет в файлы, которые он создаёт, специальную подписанную метаданные — так называемый content credential, соответствующий стандарту C2PA. Это позволяет определить, был ли файл создан или обработан с помощью Claude, но только если формат файла поддерживается (например, PNG, JPG, SVG, MP4 и др.). Инструмент проверяет только эти метаданные и не анализирует содержимое файла. Загруженный файл остаётся на устройстве пользователя, не сохраняется и не используется дальше. Обнаружение водяных знаков в тексте, созданном Claude, возможно через отдельный Detection API, но он пока доступен только организациям по требованию ЕС. Аналогичные системы проверки происхождения контента существуют у OpenAI, Google DeepMind и Gemini. C2PA — открытый стандарт, используемый также в фототехнике и редакторах для отслеживания источника медиафайлов.

by frexs • 02 сентября 2026 г. в 12:23 • 157 points

ОригиналHN

#c2pa#claude#deepmind#detection-api#gemini#google#jpg#openai#png#svg

Комментарии (119)

C2PA-метаданные в файлах Claude легко удаляются, но их подпись не подделывается без ключа Anthropic — система односторонняя: отсутствие метаданных не доказывает отсутствие участия Claude, наличие — подтверждает. Способы обхода и ограничения: - При упаковке медиа в ZIP метаданные теряются без изменения содержимого. - Загрузка своего изображения с запросом «верни как есть» приводит к добавлению C2PA, что показывает: метаданные встраиваются на этапе презентации, а не генерации. - В SVG метаданные хранятся как `<c2pa:manifest>`, в PNG — как chunk `caBX`; удаляются вручную без повреждения файла. - Проверка не работает для PDF, Excel, кода и других текстовых форматов, хотя они часто генерируются LLM, что ограничивает практическую ценность. - C2PA не работает для файлов, обработанных сторонними инструментами (ImageMagick, ffmpeg и т.п.) — даже если они созданы Claude. - Anthropic не встраивает водяные знаки в код: невидимые символы нарушают функциональность. - Пользователи могут обойти систему, переформулируя выводы Claude через другую LLM (уязвимость к цепочкам моделей). Технические детали: - Проверка выполняется на клиенте через WebAssembly-версию Rust-библиотеки c2pa-rs — файлы не отправляются на сервер. Дискуссии о ценности: - Водяные знаки нужны в основном для соответствия EU AI Act, но закон охватывает только изображения, видео и аудио — для текста они избыточны. - Одни считают наличие метаданных единственным надёжным признаком участия Claude, другие — что их отсутствие ничего не доказывает. - Обсуждается обучение дискриминатора для различения Claude и других LLM с последующим созданием де-водяного знака. - Компании могут использовать C2PA не против подделок, а чтобы их выходные данные не попадали в обучающие наборы других моделей. Итог: C2PA не решает проблему доверия к контенту — метаданные удаляются, а их отсутствие не доказывает отсутствие AI-генерации. Ключевой вопрос остаётся этическим: «поставил бы человек свою подпись под этим?»

Quasar 438B: Europe's Leading AI Model (multiversecomputing.com)

Quasar 438B — это флагманская модель Multiverse Computing, первая крупномасштабная ИИ-модель компании, ориентированная на корпоративные агенты и программирование. Она работает на английском и испанском языках и набрала 43 балла в индексе Artificial Analysis Intelligence Index v4.1.1 — лучший результат среди европейских моделей. Индекс объединяет девять тестов, включая GDPval-AA, τ³-Banking, Terminal-Bench, SciCode и другие. Quasar опережает Mistral Medium 3.5 (30 баллов), NVIDIA Nemotron 3 Ultra (38) и Inkling (42), уступая только лидерам вроде Claude Opus 5 (63).

Помимо высокой точности, модель демонстрирует выдающуюся скорость: генерация 500 токенов с учётом времени рассуждения занимает всего 15,3 секунды. Это быстрее, чем у большинства конкурентов — только три модели отвечают быстрее, и лишь одна из них (Gemini 3.7 Flash) превосходит Quasar по интеллекту. По сравнению с Mistral Medium 3.5, Quasar не только точнее (43 против 30), но и быстрее (15,3 с против 18,8 с). В долгосрочном контексте (AA-LCR) модель набрала 75,0 балла — на уровне Grok 4.6 и близко к Claude Opus 5 (75,7), превосходя Nemotron 3 Ultra на 4,0 и Mistral на 9,7 пунктов. На Terminal-Bench v2.1 Quasar набрал 69,3, опережая Mistral на 18,7 и Nemotron на 15,4 балла, что подтверждает её силу в агентном программировании и работе с терминалом. Модель доступна через API CompactifAI без необходимости развёртывания собственной инфраструктуры.

by amunozo • 02 сентября 2026 г. в 10:02 • 167 points

ОригиналHN

#anthropic#claude-opus-5#gemini#llm#mistral#multiverse-computing#nvidia#quasar-438b

Комментарии (106)

Обсуждение ставит под сомнение оригинальность и превосходство Quasar 438B: ряд комментаторов (walrus01, comandillos, fantyoon, espadrine) считают её дообученной китайской моделью (GLM-5.2, Qwen, Nemotron). scrollaway, ссылаясь на личную встречу с CEO и участие в EIC Accelerator, указывает на реальный продукт и финансирование. Большинство сходится в том, что закрытые веса делают бенчмарки недостоверными, а модель при этом уступает Qwen-3.8-27B почти впятеро меньшей по размеру. Заявления о квантовом сжатии (80–95 % без потери точности) воспринимаются как маркетинговый шум без подтверждений. Часть участников (DeathArrow, torginus) отмечает непрозрачность финансирования и руководства, подозревая использование грантов без достаточной технологической базы. Титул «Europe's Leading AI Model» считается низким порогом — модель уступает более сильным китайским и американским LLM. Рекомендации: открыть веса или предоставить воспроизводимые протоколы бенчмаркинга; интеграция в OpenRouter повысит доступность; модель может найти нишу в европейском суверенитете данных, если будет соответствовать EU-AI-Act и размещаться в ЕС; избегать преувеличенных формулировок и оценивать модели по реальным метрикам, а не по слоганам. Сообщество хочет видеть открытые европейские альтернативы китайским моделям (Mistral, Laguna) и рассматривает проект как потенциального конкурента в этом направлении.

Gemini Omni 1.1 Flash (blog.google) 🔥 Горячее 💬 Длинная дискуссия

Gemini Omni 1.1 Flash — это обновлённая версия генеративной модели от Google DeepMind, ориентированная на профессиональное создание видео через API. Она добавляет студийный уровень контроля: теперь можно плавно расширять сцены на основе до 10 секунд предыдущего контекста (раньше — только последняя секунда), что обеспечивает лучшую визуальную согласованность и позволяет создавать истории длиной до 40 секунд шагами по 10 секунд. Также реализована генерация видео между заданными первым и последним кадрами — идеально для сложных переходов, орбит камеры или зацикленных клипов без скачков.

Для ускорения прототипирования доступен режим 360p: генерация происходит до 60% быстрее и в три раза дешевле, чем в стандартном 720p, что удобно для раскадровок и быстрой итерации. По готовности можно апскейлить результат до 4K с сохранением деталей. Модель уже интегрирована в Google AI Studio, Gemini Enterprise Agent Platform и доступна подписчикам Google AI Plus, Pro и Ultra в Google Flow и Gemini app. Официальная документация, кукбук и гайды по промптингу помогают разработчикам внедрять эти возможности в свои инструменты и рабочие процессы.

by saretup • 27 августа 2026 г. в 17:06 • 280 points

ОригиналHN

#360p#4k#api#deepmind#gemini#gemini-enterprise-agent-platform#gemini-omni-1.1-flash#google#google-ai-studio#video-generation

Комментарии (208)

Тред почти не обсуждает техническую сторону Omni 1.1 Flash; вместо этого доминируют индустриальные и культурные последствия генеративного видео. Прозвучали конкретные сигналы удара по смежным профессиям (актёры озвучки, фотографы, иллюстраторы), скепсис по поводу практической пользы и контроля, а также единичные пользовательские наблюдения о поведении модели.

  • Участники массово фиксируют исчезновение «небрендовых» креативных работ: @earthnail называет произвольную озвучку «мёртвой», @anonzzzies описывает по опыту из своего города, что меню/афиши/баннеры ресторанов и событий теперь генерирует OpenAI, а его знакомый фотограф перешёл на свадьбы, потому что коммерческие съёмки «plummeting» с конца прошлого года.

  • Несколько комментаторов (@thangalin, @apwheele, @NooneAtAll3, @cube00, @DataDive, @bluerooibos) сходятся на том, что видеогенерация пока слаба для реальных задач: модели «дрейфуют» и не держат 30+ секунд, синхронизация с заранее записанным аудио не работает, а нетворческие превью в 360p при повторном запуске дают другой результат из-за недетерминированности.

  • Пользователи (@037, @vardump, @ygouzerh, @GaggiX, @fg137) сообщают, что демо-страница Google плохо работает в Firefox и в целом неудобна на десктопе: бесконтрольный инстант-скролл назад к видео после ручного скролла, много тяжёлых видео; @037 в шутку предлагает гугловцам «P.S. Make sure the page works in Firefox too».

  • Совет: @cube00 советует использовать низкое разрешение 360p только как драфт: при одинаковом промпте на 720p результат отличается из-за недетерминированности, поэтому превью — это лишь проверка идеи, а не воспроизводимый рендер.

  • Совет: @andsoitis указывает, что тема влияния на актёров всё-таки обсуждалась, и даёт поисковый запрос на Algolia HN для тех, кому нужен контекст прошлых дискуссий и профсоюзные кейсы (упоминается контракт SAG-AFTRA против нелицензированных AI-перформансов).

  • @petcat и @lambda отмечают, что экранные и голосовые актёры защищены профсоюзами (SAG-AFTRA), которые целенаправленно бастовали и выторговывали пункты про AI, в отличие от разработчиков, не имеющих коллективного рычага.

  • Спор: @porridgeraisin и @deadlast2 считают автоматизацию креативных профессий логичным продолжением истории труда (как когда-то исчезли чертёжники), а @space_fountain и @DataDive возражают: инструменты «отлично делают слоп», но почти бесполезны для художественного видения и лишают визуальный контент обещания реальности, делая его «массивом пикселей, расставленных алгоритмом на 2D-экране».

  • Часть комментаторов (@bluerooibos, @chermi, @SpyCoder77, @CmonGoogle) выражает усталость и недоверие к маркетингу: пользователи «онемели» к апдейтам, @chermi саркастически вспоминает «3.5prowithinamonth», а @CmonGoogle формулирует три ложные предпосылки, на которых держится нарратив фрагментации AI-брендов Google.

  • Совет: @thangalin демонстрирует свой работающий self-hosted пайплайн для аудиокниг — контейнеризованное веб-приложение, озвучивающее его sci-fi роман локально с несколькими нарраторами и персонажами (скриншоты keenlore), показывая практический пример замены актёров озвучки.

  • @petegleeson ловит явный failure модели в маркетинговом видео: цитата хвалит «accuracy» Omni Flash, а в кадре аргентинский футболист в майке «RESSC», что показывает, как минимум для текста на форме, заявленная точность не выдерживает проверки.

  • @simonw ставит релиз в стратегический контекст: OpenAI фактически бросил Sora, а Google продолжает инвестировать в генерацию видео, возможно, потому что это путь к «world models», тогда как новой версии Gemini Pro давно нет — это подтверждает @guilhermeasper фразой «Google does anything except launch a new version of Gemini Pro».

  • Совет: @shreya1999 формулирует сдвиг рынка: «сырое» качество генерации уже стало baseline-ом, конкуренция теперь идёт за контролируемость, а @overflowy предупреждает, что откажется от любого бизнеса, использующего сгенерированные видео в продакшене.

  • Спор: @dominotw спорит с нарративом массовой автоматизации: AI хорошо работает только там, где есть компиляторы, тесты, CI и «куча данных» (например, hiring через Mercor), во всём остальном он «sucks», что противоречит видению @deadlast2 о скором поглощении всех индустрий.

Ox Alpha (openrouter.ai)

Ox Alpha — reasoning‑ориентированная модель, предназначенная для длительных задач в программировании, агентных workflow’ах и производственных нагрузках, где требуется сочетание текста и визуального контекста.

Ключевые детали: бесплатный доступ без обязательных расходов, контекстный размер до 1 млн токенов, 100 % uptime у единственного провайдера, средняя задержка ≈ 3,76 секунды и пропускная способность ≈ 33 tps. Ценовая модель — «stealth», то есть провайдер остаётся анонимным, а запросы и ответы хранятся у него, но не используются для дообучения.

Запомните: 75 % скидка на Gemini 3.7 Flash ограничен во времени, а Ox Alpha поддерживает мультимодальные запросы — текст, изображения и видео одновременно.

by mtokmak06 • 20 августа 2026 г. в 23:56 • 153 points

ОригиналHN

#gemini#openrouter.ai#ox-alpha

Комментарии (114)

Пользователи выражают серьёзные опасения по поводу Ox Alpha: неизвестный провайдер, отсутствие прозрачности, подозрительная скорость (~30 токенов/сек) и низкий объём вывода не соответствуют типичным характеристикам крупных китайских лабораторий. Модель плохо генерирует CSS — заменяет динамические значения на жёстко закодированные цвета, слабо справляется с визуальным рассуждением. Хотя в креативных задачах она иногда превосходит K3, её производительность непредсказуема. Заявления о бесплатности и отсутствии обучения на запросах вызывают сомнения — проверить их невозможно. Передача конфиденциальных или проприетарных данных рискованна из-за неизвестного происхождения: одни считают модель китайским GLM‐5.x вариантом (на основе анализа thinking traces и guardrails), другие — американской или европейской, исходя из ограничений. Модель часто маршрутизирует запросы между провайдерами, затрудняя идентификацию источника. Отсутствие публичной карточки модели и прозрачных safety-механизмов критикуется как неприемлемое для stealth-моделей. Бесплатный доступ сопровождается скрытыми ограничениями — лимиты на запросы не раскрыты. Рекомендуется не использовать Ox Alpha в рабочей среде без явного одобрения компании — только как эксперимент. Для определения происхождения советуют анализировать guardrails: абсурдные ограничения — признак US-моделей, отсутствие или умеренные — китайских. Некоторые пользователи используют модель для открытого кода, считая риск минимальным.

How to disable or avoid intrusive AI (librarian.net)

Отключить навязчивый ИИ — частая задача для тех, кто хочет сохранить контроль над своим цифровым пространством. Главное правило: сначала выключайте функции, которые явно нарушают привычный интерфейс — например, в Adobe Acrobat и Reader есть отдельные разделы «Generative AI», где достаточно снять галочку и сохранить настройки. На мобильных платформах, особенно в Android-смартфонах с встроенным Gemini, отключить ассистента можно через настройки приложения «Messages» или раздел «Connected Apps», где отключаются как Gemini, так и «Personal Intelligence». На iOS и macOS Apple Intelligence требует полного отключения в «Apple Intelligence & Siri», а также отключения «Learn from this App» в настройках приложений, даже если основной режим выключен. Для браузеров с встроенным Copilot в Chrome флаг GLIC скрывает все AI-функции, а в Windows можно использовать O&O ShutUp 10 или Win11DeBloat для полного удаления Copilot. Yahoo Mail и Zoom тоже предлагают отключить AI-анализ писем и транскрибирование встреч через меню настроек. Важно помнить: многие сервисы включают AI по умолчанию, поэтому проверяйте параметры регулярно — особенно в Zoom, где новые функции появляются часто. Для полного контроля рекомендуется использовать альтернативные браузеры вроде Zen или Helium, а также следить за обновлениями в библиотечных ресурсах, где публикуются актуальные гайды по сопротивлению нежелательным технологиям.

by ColinWright • 17 августа 2026 г. в 14:07 • 210 points

ОригиналHN

#acrobat#adobe#android#apple#chrome#gemini#reader#siri#windows#zoom

Комментарии (112)

Пользователи сталкиваются с системным принуждением к ИИ: корпорации намеренно делают его неотделимым от базовых функций, блокируя ключевые возможности при отключении — например, отключение Siri в CarPlay лишает доступа к картам и музыке без телефона. ИИ-функции добавляются не для улучшения опыта, а для привлечения инвестиций, несмотря на рост эксплуатационных расходов и отсутствие реальной потребности — как в PDF-редакторах Adobe. Для отключения ИИ: — В Google добавляйте `udm=14` или фильтр `-fuck` для подавления суммаризации; — Используйте uBlock Origin и Element Hider для скрытия AI-элементов в Google, Amazon и других сайтах; — В Chrome — расширение Adios Alexa for Shopping для блокировки всплывающих окон Alexa; — На Mac — Wairy.app для аудита и отмены разрешений (частично заблокирован за платой); — Переход на Linux устраняет навязчивый ИИ из macOS и Windows; — Альтернативные браузеры Zen и Helium (на базе Firefox и Chromium) предлагают чистый интерфейс без ИИ-элементов. Самый эффективный способ — отказ от продуктов, где ИИ нельзя отключить, что упрощает цифровую жизнь. NoToAI.org — открытый ресурс сообщества для отслеживания способов отключения ИИ.

Models Are Getting Dumber on Purpose (w4g1.dev)

Модели сознательно «обнуляют» знания ради эффективности: активные параметры падают с сотен миллиардов до 13–40 млрд, но при этом их способность к рассуждению растёт. Например, GLM-5.2 с 40 млрд активных параметров на токен достигает 99,2 % на AIME 2026, а Qwen3.5 9B — 91,3 % при 17 млрд активных. При этом на простых фактических вопросах (SimpleQA) лучший результат — лишь 53 % у Gemini 2.5 Pro, а маленькие модели показывают 80–82 % галлюцинаций. Это происходит потому, что знания занимают «тяжёлый» объём весов (≈2 бита на факт), тогда как алгоритмы рассуждения сжаты до скромного набора процедур, которые легко передаются в компактные модели через синтетические данные и RL‑fine‑tuning.

Таким образом, современные системы хранят лишь «широту» знаний — общую картину мира, достаточную для выбора правильного источника, — а детали (версии API, даты релизов, редкие формулы) вынесены в внешние базы. Это делает их устойчивыми к устареванию фактов, но требует runtime‑подключения к актуальному контенту. В результате ошибки в знаниях становятся обычными данными, исправляемыми без переобучения, а «галлюцинации» превращаются в проверяемые ссылки, что радикально снижает риск уверенного, но неверного ответа. В будущем модель будет почти полностью полагаться на внешние источники, а её веса будут служить лишь гибким «интерпретатором» запросов.

by hruvhwe • 16 августа 2026 г. в 19:04 • 166 points

ОригиналHN

#aime#gemini#glm#qwen#simpleqa

Комментарии (104)

Тред обсуждает перспективы и ограничения моделей, намеренно «обнуляющих» знания для эффективности, и возможность использования плаггабельных моделей для решения конкретных задач. @kennywinker предлагает плаггабельные модели знаний, не требующие знания всех языков программирования. @gopalv и @stanac поддерживают идею систем из нескольких специализированных моделей как более эффективной альтернативы одной универсальной, причём @stanac отмечает, что плаггабельные модели требуют базовых для работы. @jimmaswell возражает: модели с большим объёмом параметров и разнообразным знанием работают лучше, даже если это неочевидно, и структура задачи может скрываться в неожиданных источниках, например, в древних китайских стихах. @lowsong опровергает утверждение автора, что перемещение информации из весов в контекст устраняет галлюцинации — это не гарантирует точности выводов.

Gemini 3.7 Flash (blog.google) 🔥 Горячее 💬 Длинная дискуссия

Гемини 3.7 Flash — новое поколение «рабочей лошадки» от Google, созданное для сложного программирования и агентных сценариев. За три недели после релиза 3.6 Flash компания представила модель с существенно улучшенным пониманием кода, точностью генерации и способностью работать с длинными цепочками задач. На тестах FrontierCode 1.1 точность выросла с 34,4 % до 43,6 %, а в DeepSWE v1.1 — с 49,0 % до 65,3 %. В веб‑разработке 3.7 Flash генерирует полноценные приложения и UI‑компоненты из меньшего числа промптов, а на Arena.ai WebDev Arena набрал Elo 1588 против 1538 у предшественника.

Особенно заметны рост точности в обработке тяжёлых документов: на бенчмарке GDP.pdf показатель вырос с 22 % до 34 %, а в AutomationBench — с 17 % до 30,4 %. Стоимость остаётся вдвое ниже, чем у 3.6 Flash (0,75 $/млн входных и 3,75 $/млн выходных токенов), а новая версия лучше адаптируется к подводным камням, уточняет намерения пользователя и требует меньше ручного контроля. Теперь разработчики могут использовать её в Google AI Studio, Android Studio и через Gemini Enterprise, а обычные пользователи — в Spark внутри приложения Gemini.

by thisisauserid • 13 августа 2026 г. в 17:23 • 906 points

ОригиналHN

#android-studio#gemini#gemini-3.7-flash#gemini-enterprise#google#google-ai-studio#language-model#llm#spark

Комментарии (453)

Gemini 3.7 Flash лидирует по скорости и низкой задержке, что критично для интерактивных сценариев (например, Google AI Mode), но страдает от сложного парсинга «мыслей», академичного стиля ответов и неконкурентоспособной долгосрочной цены — после 2026 года тариф удваивается, при этом модель к тому времени устареет. Пользователи отмечают: - Модель лучше подходит для агентных задач и быстрых итераций, но слаба в сложном кодинге и рефакторинге — уступает GPT-5.6 Luna, DeepSeek и Opus. - Вывод требует значительной очистки от внутренних монологов, усложняя интеграцию. - Стиль ответов стал менее интуитивным, вероятно, из-за RLVR-тренировок. - Галлюцинации и ложные утверждения сохраняются в серии Flash (3.1–3.7), снижая доверие по сравнению с Claude или Sol. - Генерация SVG сломана в Firefox и Chrome из-за невалидных фильтров — проблема кросс-браузерной совместимости. - В image-to-html уступает Opus 5, но сопоставима с Grok 4.6. - Интеграция в Android-ассистента ухудшила UX: модель галлюцинирует инструкции и отказывается выполнять простые команды. - Google Cloud: запутанная номенклатура (Gemini, Anti-gravity, Vertex) и сложная регистрация CLI-инструментов отталкивают разработчиков. - Для специфических задач (анализ рынков на Rust) Stepfun AI Step-3.5-Flash дешевле и эффективнее. - AA-метрика выросла за счёт увеличения токенов вывода, а не качества — экономика использования изменилась. - Качество ответов («vibes») остаётся важнее бенчмарков: пользователи предпочитают Claude за стиль, несмотря на цифры. Споры о целесообразности: одни считают 3.7 Flash избыточным на фоне более дешёвых и быстрых альтернатив, другие — востребованным для быстрых задач, где превосходит Sonnet 5 и Opus.

Stealing Reasoning Traces from Proprietary LLM APIs (stolen-thoughts.com) 🔥 Горячее 💬 Длинная дискуссия

Исследователи показали, что закрытые модели ИИ — такие как Claude Opus, GPT-4 и Gemini — раскрывают свои внутренние цепочки рассуждений через зашифрованные «следы», которые API возвращает клиенту. Эти следы можно переносить между сессиями и моделями: если вставить их в более слабую, но взломанную версию той же модели (например, Claude Haiku), она расшифровывает и воспроизводит рассуждения сильной модели в открытом виде — без прямого доступа к ней и обходя все меры защиты от дистилляции. В экспериментах на 120 задачах из Codeforces восстановленные цепочки точно совпадали с числом скрытых токенов, заявленных API.

В расшифрованных следах обнаружены чувствительные данные: 64 из 704 утечек (включая API-ключи, пароли, токены GitHub и Hugging Face, email, паспорта, номера карт и внутренние URL) присутствовали только в рассуждениях, а не в видимом ответе. Например, в одном случае был восстановлен полный бронь авиабилета — имя, паспорт, карта, предпочтения — всё внутри «мышления» модели. Это означает, что даже при отсутствии явного вывода конфиденциальных данных, они могут утекать через скрытые логи рассуждений, что ставит под угрозу безопасность и конфиденциальность пользователей.

by quantumgarbage • 11 августа 2026 г. в 13:22 • 557 points

ОригиналHN

#anthropic#claude-haiku#claude-opus#codeforces#gemini#github#google#gpt-4#hugging-face#openai

Комментарии (238)

Тред дополняет статью опытом эксплуатации уязвимости, возражениями против термина «stealing» и обсуждением последствий для безопасности и доверия к ИИ-моделям. Термин «stealing» неуместен: пользователи оплатили токены и имеют право на доступ к информации, сгенерированной с их участием. Спор: одни считают уязвимость незначительной, так как её можно исправить шифрованием данных на сервере; другие — что это серьёзная угроза, позволяющая атаковать модели ИИ, включая «fake thinking» — манипуляцию выводами модели с использованием извлечённых данных. Рекомендация: разработчикам необходимо исправить уязвимость, обеспечить безопасность данных и быть прозрачными в использовании и обработке пользовательской информации. Последствия уязвимости — угроза безопасности и доверию к ИИ — требуют срочных мер для предотвращения атак.

Discovery Loop (discoveryloop.com) 🔥 Горячее 💬 Длинная дискуссия

Научный прогресс застопорен из-за рутинных экспериментальных циклов: гипотеза — запуск — анализ — корректировка. Discovery Loop предлагает автоматизировать весь этот процесс, используя ИИ и вычислительные мощности для одновременного проведения тысяч экспериментов. Это сокращает время итераций и повышает качество результатов, особенно в машинном обучении, где первые шаги будут направлены на оптимизацию собственной технологической инфраструктуры.

Команда, состоящая из Джеффа Диана, Санджая Гематева, Квока Лэ и Ориоля Виньяльса, объединяет экспертизу в создании ключевых технологий: от TensorFlow и Pathways до AlphaFold и Gemini. Их преимущество — не только глубокие навыки, но и опыт построения систем, масштабирующих вычисления на уровне всего мира. Цель — дать исследователям и инженерам возможность ускорять открытия, решая задачи от разработки лекарств до обеспечения чистой воды, превращая науку в более доступный и эффективный процесс.

by xtreak29 • 05 августа 2026 г. в 16:19 • 816 points

ОригиналHN

#alphafold#clean-water#discovery-loop#drug-discovery#gemini#machine-learning#pathways#tensorflow

Комментарии (507)

Тред обсуждает потенциал и ограничения автоматизации научных исследований, особенно в ML и ИИ, выражая сомнения в возможности полной автоматизации экспериментальных циклов — например, в биологии. Участники подчеркивают, что автоматизация полезна, но не должна заменять человеческий интеллект и критическое мышление. Отмечается впечатляющий опыт команды Discovery Loop в ML и ИИ. Также предупреждают о рисках: ошибках и предвзятости алгоритмов, а также о том, что не все научные процессы поддаются автоматизации.

Changes at Google DeepMind: Demis Hassabis from CEO to Chair, Jeff Dean departs (blog.google) 🔥 Горячее 💬 Длинная дискуссия

Google DeepMind перестраивает команду, чтобы ускорить путь к AGI и науке. Демис Хассабис уходит с поста CEO DeepMind, становясь председателем GDM и главным научным советником Alphabet, чтобы полностью сосредоточиться на формировании будущего искусственного интеллекта. Кори Ковакчуглу возглавит DeepMind как SVP, отвечая за Gemini, Frontier AI и разработки, используя свой 13-летний опыт в создании таких прорывов, как WaveNet и DQN.

Корпорация объявила о создании независимой компании Джеффа Диана и Санджая Гемава, которая будет ускорять научные открытия в области ML и биотехнологий. Джефф, ключевая фигура в истории Google (поиск, нейросети), уходит с поста в Google, чтобы реализовать личные амбиции. Главы подчеркивают, что Gemini достиг 950 млн пользователей, а Isomorphic Labs Хассабиса уже работает над лечением заболеваний, таких как рак. Культура DeepMind, объединяющая таланты, сохраняется, но структура меняется для более гибкого развития.

by colesantiago • 05 августа 2026 г. в 16:05 • 740 points

ОригиналHN

#alphabet#deepmind#demis-hassabis#dqn#gemini#google#isomorphic-labs#jeff-dean#llm#wavnet

Комментарии (797)

Уход Демиса Хассабиса, Джеффа Дина и Санджая Гхемавата из Google может свидетельствовать о внутренних проблемах — потере фокуса на научных исследованиях и неспособности конкурировать в ИИ. Их уход — значительная потеря, поскольку они были ключевыми фигурами в области ИИ и машинного обучения. Некоторые связывают это со сменой стратегии, другие — с естественной текучестью. Пользователь @fhub предлагает инвестировать в проекты Дина и Гхемавата, чтобы удержать их опыт.

Google fixed more Chrome bugs in June than over the past two years, thanks to AI (blog.google) 🔥 Горячее 💬 Длинная дискуссия

Chrome использует искусственный интеллект для автоматического поиска, отладки и исправления уязвимостей, ускоряя весь цикл: обнаружение, приоритизацию, исправление и выпуск обновления. В 2026 году команда нашла уязвимость, существовавшую более 13 лет, позволяющую выйти из песочницы через рендерер — первый случай, когда Gemini выявил такой баг. Для повышения эффективности они объединили модели с разными весами, создали базу знаний Chrome, включая историю Git и ранее выявленные уязвимости, добавили «критика»‑агент и требовали от разработчиков добавлять SECURITY.md, чтобы модели лучше понимали границы доверия. Все решения оборудуют защитными ограничениями, чтобы избежать непредвиденного поведения.

Для своевременного патчинга они интегрировали сканирование уязвимостей из NVD и OSV, а также перешли к автоматическому обновлению всех сторонних зависимостей, используя сигналы GOSSIP для оценки рисков. Цель — выкатывать исправления быстрее, чем могут их использовать злоумышленники, и обеспечить непрерывную защиту без вмешательства пользователя. Таким образом, каждая найденная и исправленная уязвимость уменьшает возможность атаки, а ИИ усиливает возможности защиты, делая браузер и интернет безопаснее с каждым обновлением. Это устраняет сотни потенциальных точек входа для атак и повышает устойчивость к новым угрозам.

by Garbage • 31 июля 2026 г. в 07:29 • 503 points

ОригиналHN

#chrome#gemini#google#gossip#llm#nvd#osv#patch#security#vulnerability

Комментарии (519)

ИИ может эффективно помогать в обнаружении и исправлении ошибок, но рискует вводить новые ошибки или упускать редкие случаи. Некоторые участники треда считают, что он не заменит человеческий фактор — требует проверки, не учитывает все нюансы и не должен использоваться как единственный инструмент. По опыту @glimshe, ИИ полезен для ускорения работы, но не для полной автоматизации.

Not everyone is using AI for everything (gabrielweinberg.com) 🔥 Горячее 💬 Длинная дискуссия

В США лишь около трети населения активно используют генеративный ИИ, треть — периодически, а треть вовсе не пользуются им. Опрос Gen Z показывает, что 21 % никогда не обращаются к ИИ, тогда как 32 % применяют его лишь раз в месяц или реже. По данным Microsoft, только 30 % работающих американцев взаимодействуют с крупными сервисами (ChatGPT, Gemini, Claude, Copilot) минимум 90 минут в месяц, а исследование Datos выявило, что 62 % десктопных устройств не посещают AI‑инструменты вовсе.

Эти цифры опровергают распространённый миф о том, что «все используют ИИ во всём». Большинство пользователей применяют его лишь изредко, а уровень недоверия растёт: Gallup отмечает рост «злобы» по отношению к ИИ на 40 % за год. По данным Searchlight Institute, 58 % американцев пробовали или используют ИИ, из них 30 % – регулярные (несколько раз в месяц) и 29 % – лишь раз в месяц или реже, что совпадает с результатами Microsoft и Datos. Исследование The Argument выявило, что большинство используют ИИ не чаще одного раза в неделю. Таким образом, реальная ситуация выглядит как «некоторые люди используют ИИ для некоторых задач», а не как всеобщее внедрение.

by yegg • 14 июня 2026 г. в 14:44 • 512 points

ОригиналHN

#claude#copilot#gemini#llm#microsoft

Комментарии (546)

  • Большинство интервьюers спрашивают, как вы используете LLM, но ответить сложно из‑за противоречивых интересов работодателей.
  • В некоторых областях (например, в коде) LLM уже показывают большую ценность, в других — требуют тщательного контроля и часто оказываются разочаровывающими.
  • Мнения разделяются: одни считают, что «все используют AI», другие указывают, что реальное внедрение пока ограничено и часто носит экспериментальный характер.
  • Критики отмечают, что рост AI‑технологий часто мотивирован ленью и желанием ускорить процесс, а не качеством решения.

Gemini CLI Tips and Tricks for Agentic Coding (github.com) 🔥 Горячее

Репозиторий собирает практические советы и трюки для работы с Gemini CLI — командной строкой для модели ИИ Gemini от Google. Он охватывает оптимизацию промптов, автоматизацию задач, интеграцию с shell-скриптами и продвинутые техники, такие как цепочки вызовов, обработка ошибок и кастомные алиасы. Авторы подчёркивают, как ускорить разработку: например, генерация кода за секунды или анализ логов одним вызовом.

Ключевые фичи включают примеры для новичков (простые запросы) и экспертов (мультимодальные входы, fine-tuning через CLI). Репозиторий обновляется сообществом, с 50+ tips, включая хитрости вроде --stream для реального времени и JSON-вывод для парсинга. Идеально для devops и скриптеров: экономит часы рутины, повышая продуктивность на 3–5x по отзывам.

by ayoisaiah • 26 ноября 2025 г. в 18:08 • 375 points

ОригиналHN

#claude#codex#devops#gemini#gemini-cli#github#google#shell

Комментарии (129)

  • Большинство критикует Gemini CLI за ненадёжность, медленность (10-80 сек на простые запросы), слабые инструменты и циклы ошибок.
  • Предпочтение Claude Code и Codex как более эффективным агентам для кодирования; модель Gemini 3 хвалят, но CLI — нет.
  • Жалобы на игнор файлов, отсутствие плана, фрагментацию CLI по моделям и быстрое устаревание советов.
  • Желание LLM-агностичного агента и стандартизации; некоторые советы полезны, но "крик" на AI часто работает лучше.

Nano Banana Pro (blog.google) 🔥 Горячее 💬 Длинная дискуссия

Google представила Nano Banana Pro — новую модель генерации и редактирования изображений от Google DeepMind. Эта модель относится к семейству Gemini 3 Pro и предназначена для работы с визуальным контентом. Несмотря на необычное название, Nano Banana Pro позиционируется как продвинутый инструмент для создания и модификации изображений с использованием ИИ.

Модель разработана командой Google DeepMind, которая активно работает над улучшением возможностей генеративного ИИ. Nano Banana Pro дополняет существующие продукты Google в области искусственного интеллекта, предлагая пользователям новые способы работы с визуальными данными. Хотя подробности о технических характеристиках пока ограничены, сам факт анонса указывает на расширение функционала экосистемы Gemini.

by meetpateltech • 20 ноября 2025 г. в 15:04 • 1214 points

ОригиналHN

#gemini#google-deepmind#image-generation#llm#synthid

Комментарии (645)

  • Google выпустил Nano Banana Pro, но не смог обеспечить доступ к API, что вызвало недовольство разработчиков.
  • Модель демонстрирует улучшенную точность текста и способность к генерации инфографик, но остаётся неясным, как именно она обрабатывает изображения.
  • SynthID, как и ожидалось, не решает проблему идентификации ИИ-контента, а лишь маркирует изображения, что вызывает вопросы о возможности его обхода.
  • Несмотря на то, что Google продолжает доминировать в качестве изображений, его стратегия ведения бизнеса вызывает всё большее раздражение.

Google Antigravity (antigravity.google) 🔥 Горячее 💬 Длинная дискуссия

Google в 2005 году запустил знаменитую первоапрельскую шутку, объявив о внедрении технологии "антигравитационного поиска". Компания утверждала, что их алгоритмы теперь способны индексировать веб-страницы, буквально "парящие" в интернете. На демонстрационной странице результаты поиска медленно поднимались вверх и оставались в воздухе, создавая иллюзию невесомости. Эта шутка быстро стала вирусной и до сих пор считается одной из самых креативных в истории April Fools.

Интересно, что многие пользователи всерьез восприняли объявление и начали спрашивать, как сделать свои сайты "антигравитационными". Google даже добавил специальную ссылку "Как это работает", где с юмором объяснял "технологию". Шутка настолько запомнилась, что до сих пор упоминается при обсуждении истории Google и их знаменитых первоапрельских розыгрышей, которые стали важной частью корпоративной культуры компании.

by Fysi • 18 ноября 2025 г. в 15:47 • 1002 points

ОригиналHN

#april-fools#gemini#google#ide#llm#vscode

Комментарии (981)

  • Antigravity позиционируется как AI-IDE, но воспринимается как незрелый форк VS Code с множеством багов, ошибок квот и проблем с авторизацией.
  • Пользователи выражают недоверие к Google из-за истории закрытия сервисов ("Google Graveyard") и опасения по поводу доступа к коду.
  • Сравнение с конкурентами (Cursor, Windsurf) показывает, что Gemini 3 часто уступает другим моделям, а функционал не предлагает инноваций для перехода.
  • Интерфейс критикуется за "vibe-coded" дизайн, проблемы с прокруткой и нестандартные размеры элементов, что ухудшает юзабилити.
  • Концепция "агентного" развития воспринимается скептически: идея "повышения до менеджера агентов" не вызывает энтузиазма у разработчиков.

Project Gemini (geminiprotocol.net) 🔥 Горячее 💬 Длинная дискуссия

Project Gemini — это новая интернет-технология для создания электронной библиотеки взаимосвязанных текстовых документов. Проект не стремится к инновациям или разрушению существующих технологий, а предлагает альтернативу для тех, кто считает, что интернет уже достаточно изменился. Gemini нацелен на создание легковесного онлайн-пространства, где документы остаются просто документами с учётом приватности, внимания и пропускной способности пользователей.

Проект распространяется под лицензией CC BY-NC-ND 4.0 и предлагает обширную документацию, включая FAQ, видеообзор, историю развития и список программного обеспечения. Gemini не пытается изменить мир, а создаёт альтернативу, где контент остаётся простым и доступным, без излишней сложности и вторжения в личное пространство пользователей.

by andsoitis • 17 ноября 2025 г. в 15:50 • 306 points

ОригиналHN

#gemini#protocol#tls

Комментарии (172)

  • Gemini позиционируется как упрощённая альтернатива вебу, но его ограничения (запрет на встроенные изображения, скрипты и сложное форматирование) критикуются как мешающие практическому использованию.
  • Пользователи отмечают ностальгию по раннему вебу (HTML 2.0/3.2), но критикуют избыточность "не изобретай велосипед" при создании нового протокола вместо доработки существующих.
  • Основные проблемы: сложность поиска контента, необходимость новых TLS-соединений для каждого запроса, конфликт названий с другими проектами и недостаток понятного описания.
  • Несмотря на критику, некоторые ценят минимализм Gemini для личных блогов ("gemlogs") и "уютного" контента с высоким соотношением сигнал/шум.
  • Сообщество активно развивает инфраструктуру (поисковики, архивы, прокси), но протокол остаётся нишевым из-за ограничений и сложности открытия контента.

Nano Banana can be prompt engineered for nuanced AI image generation (minimaxir.com) 🔥 Горячее 💬 Длинная дискуссия

Несмотря на кажущуюся стагнацию, область генерации изображений ИИ активно развивается с появлением моделей вроде FLUX.1-dev, Seedream, Ideogram и Google Imagen 4. Однако ChatGPT с бесплатной генерацией изображений стал новым эталоном после вирусного успеха с промптом "Make me into Studio Ghibli". Его модель gpt-image-1 работает авторегрессивно, генерируя токены как текст, что делает её медленной (30 секунд на изображение), но доступной бесплатно.

В августе 2025 года загадочная модель "nano-banana" появилась на LMArena и позже была выпущена Google как Gemini 2.5 Flash Image. Её популярность вывела приложение Gemini на вершину App Store. Автор подчёркивает выдающуюся точность следования промптам Nano Banana, что делает её особенно ценной для сложных запросов. Пользователи могут генерировать изображения бесплатно через веб-версию Gemini или приложение, а разработчики - использовать API за $0.04 за изображение. Для упрощения работы с API автор создал Python-пакет gemimg.

by minimaxir • 13 ноября 2025 г. в 17:39 • 829 points

ОригиналHN

#api#gemini#google#llm#mistral#prompt-engineering#python

Комментарии (214)

  • Пользователи успешно используют Nano Banana для создания последовательных визуальных историй (сториборды, комиксы) с контролем персонажей, окружения и времени суток через многослойные промпты.
  • Модель демонстрирует ограничения: проблемы с точным рендерингом текста, стилизацией (особенно сложных персонажей), непредсказуемыми изменениями деталей при редактировании и путаницей в интерпретации направлений (лево/право).
  • Технические решения включают использование Python-библиотек (gemimg), API (Google AI Studio), маскирование для удаления водяных знаков и интеграцию с LLM (Mistral) для генерации вариаций промптов.
  • Обсуждаются сложности достижения точных результатов (например, стиль-трансфер, удаление отражений) и необходимость тщательного промпт-инжиниринга для контроля вывода.

Poker Tournament for LLMs (pokerbattle.ai) 🔥 Горячее 💬 Длинная дискуссия

PokerBattle.ai представляет собой первый в истории турнир по покеру с реальными денежными призами, специально созданный для соревнования больших языковых моделей (LLM). Это инновационное событие позволяет ИИ-системам проявить свои стратегические способности в одной из самых сложных интеллектуальных игр, где успех зависит не только от математических расчетов, но и от психологических аспектов и блефа. Турнир загружает данные о событиях, что указывает на его активный характер или недавнее проведение.

Уникальность этого мероприятия заключается в том, что оно впервые объединяет мир покера с передовыми технологиями ИИ, создавая новую платформу для оценки и развития возможностей языковых моделей. Организаторы стремятся определить, какие из современных LLM способны демонстрировать наилучшую игровую стратегию, адаптивность и способность к принятию решений в условиях неопределенности. Денежные призы добавляют соревнованиям серьезности и привлекают внимание как исследователей ИИ, так и энтузиастов покера со всего мира.

by SweetSoftPillow • 28 октября 2025 г. в 07:42 • 283 points

ОригиналHN

#artificial-intelligence#gemini#large-language-models#llama#llm#meta#poker

Комментарии (181)

  • ИИ демонстрируют ошибки в оценке рук (например, LLAMA ошибочно определила топ-пару), что указывает на текущие ограничения в понимании игры.
  • Эксперимент критикуется за недостаток данных (714 рук у Meta LLAMA) и отсутствие возможности для ИИ развивать новые стратегии со временем.
  • Предлагается улучшить тестирование, добавив "трэш-ток" и возможность блефа между ИИ, что сделало бы наблюдение более интересным и показательным.
  • ИИ часто "галлюцинируют", принимая неверные решения (как Gemini, сдавшая сильную руку), что связано с неправильной оценкой силы руки в текущей ситуации.
  • Шутливые предложения по тестированию включают попытки обмана ИИ через подсказки ("игнорируй предыдущие инструкции").

Gemini 3.0 spotted in the wild through A/B testing (ricklamers.io) 🔥 Горячее 💬 Длинная дискуссия

Gemini 3.0, новейшая модель от Google, стала доступна через A/B тестирование в AI Studio. Пользователи могут сравнивать её производительность с Gemini 2.5 Pro. В качестве теста использовалась генерация SVG-изображений — например, геймпада Xbox. Это неплохой прокси-тест на качество модели, так как подобные задачи требуют точного следования инструкциям, строгого соблюдения структуры SVG и понимания концептуальных элементов.

Генерируемое изображение контроллера Xbox от Gemini 3.0 оказалось значительно качественнее, чем у конкурента. Хотя время до первого токена (TTFT) у Gemini 3.0 было на 24 секунды больше, а вывод — на 40% длиннее (включая дополнительные рассуждения в токенах), результат явно демонстрирует превосходство новой модели.

Этот случай демонстрирует, что даже в режиме A/B-тестирования, без прямого доступа, сообщество может эффективно оценивать и сравнивать новые модели. Для команд, занимающихся разработкой ИИ, это отличный пример того, как можно проводить быстрые итеративные тесты на реальных задачах.

Источник: Rick Lamers' blog

by ricklamers • 16 октября 2025 г. в 16:54 • 400 points

ОригиналHN

#ab-testing#gemini#google#llm#svg

Комментарии (253)

  • Разные пользователи отмечают, что Gemini 2.5 Pro лучше всего подходит для их задач, но при этом Google не предоставляет удобного CLI-интерфейса, а встроенный в Google AI Studio «режим 2.5 pro» оказывается худшим вариантом.
  • Участники обсуждения подтверждают, что Gemini 2.5 Pro действительно превосходит ChatGPT и другие модели в задачах, требующих большого контекста, но при этом страдает от «залипания» в длинных диалогах и плохо справляется с инструментами.
  • Некоторые разработчики отмечают, что Gemini 3.0 пока не решает проблему «залипания» и не предоставляет удобного CLI, что делает его менее привлекательным для разработчиков.

Gemini 3.0 Pro – early tests (twitter.com)

Социальная сеть X (ранее Twitter) требует включённого JavaScript для работы. При его отключении пользователь видит сообщение о необходимости активировать JavaScript или сменить браузер на поддерживаемый, со ссылкой на список совместимых браузеров.

Также упоминается, что проблемы могут вызывать расширения для приватности — их советуют отключить. Внизу страницы приведены стандартные ссылки на условия использования, политики и информацию о рекламе.

by ukuina • 02 октября 2025 г. в 18:26 • 184 points

ОригиналHN

#claude#gemini#javascript#llm#multimodal#twitter

Комментарии (109)

  • Критика отсутствия у Google сильной продуктовой культуры, что мешает созданию инновационных продуктов на основе их же технологий.
  • Обсуждение субъективности сравнения моделей ИИ (Gemini, GPT, Claude) и сложности объективной оценки из-за различий в задачах и опыте пользователей.
  • Скептицизм по поводу рекламных кампаний и хайпа вокруг новых моделей, которые часто не соответствуют реальным возможностям.
  • Подчеркивание проблем Gemini с многократным выполнением инструкций и склонностью к "зацикливанию" по сравнению с конкурентами.
  • Отмечается сильная мультимодальность Gemini (работа с изображениями, видео), но сложность доступа и использования продуктов Google AI.

The RAG Obituary: Killed by agents, buried by context windows (nicolasbustamante.com)

RAG-архитектура, доминировавшая в AI последние три года, уступает место новым подходам. Ранние модели вроде GPT-3.5 ограничивались 4–8 тыс. токенов, что делало невозможной работу с объёмными документами — например, отчёт SEC 10-K содержит ~51 тыс. токенов. RAG решал это через разбиение текста на фрагменты (чанки) и поиск релевантных частей, но даже продвинутые методы чанкинга не спасали от потери контекста: финансовые таблицы, сноски и связи между разделами разрушались.

Современные модели с контекстом в миллионы токенов (например, Gemini 1.5) и агентные архитектуры делают RAG избыточным. Зачем извлекать фрагменты, если можно загрузить весь документ целиком? Это устраняет проблемы чанкинга, эмбеддингов и повторного ранжирования. Ключевой вывод: эра компромиссов между точностью и контекстом заканчивается — будущее за системами, работающими с полными данными без промежуточных шагов.

by nbstme • 01 октября 2025 г. в 16:51 • 226 points

ОригиналHN

#api#bm25#context-window#embedding#gemini#gpt-3.5#grep#llm#rag#sql

Комментарии (150)

  • Участники критикуют автора за чрезмерное обобщение: утверждение о "смерти RAG" основано на узком примере поиска в коде и не учитывает масштабируемость и другие сложные use-case'ы (например, миллионы документов в распределенных системах).
  • Подчеркивается, что RAG — это общий паттерн (извлечение информации + обогащение контекста), а не только векторный поиск; grep, SQL, API-вызовы или использование агента с инструментами — это тоже формы RAG.
  • Отмечается, что агентный поиск (с использованием инструментов вроде grep, BM25 и др.) может быть мощнее классического RAG, но он медленнее, дороже и сложнее из-за множественных вызовов функций.
  • Указывается, что большие контекстные окна LLM позволяют им читать целые файлы, что меняет workflow и снижает необходимость в сложных пайплайнах чанкинга и эмбеддингов.
  • Многие видят иронию в том, что автор называет RAG "кошмаром edge-кейсов", в то время как агентный подход с инструментами вроде grep introduces свои сложности (производительность, безопасность, детерминизм).

Improved Gemini 2.5 Flash and Flash-Lite (developers.googleblog.com) 🔥 Горячее 💬 Длинная дискуссия

Google выпустила обновлённые версии моделей Gemini 2.5 Flash и Flash-Lite, предлагая улучшенную производительность и эффективность. Эти модели оптимизированы для быстрой обработки запросов и снижения задержек, что делает их идеальными для приложений, требующих мгновенных ответов, таких как чат-боты и голосовые помощники.

Обновления включают повышение точности и снижение потребления ресурсов, что позволяет разработчикам интегрировать ИИ в продукты с ограниченными вычислительными мощностями. Это особенно важно для мобильных устройств и edge-устройств, где эффективность играет ключевую роль.

by meetpateltech • 25 сентября 2025 г. в 17:20 • 520 points

ОригиналHN

#anthropic#chatbots#edge-computing#gemini#google#llm#machine-learning#openai#voice-assistants

Комментарии (263)

  • Пользователи отмечают проблемы с надежностью Gemini: обрывы ответов, непредсказуемое поведение, высокая частота ошибок и галлюцинаций.
  • Многие критикуют запутанную систему версионирования моделей Google, где обновления не отражаются в номере версии (например, новый 2.5 вместо 2.6), что вызывает путаницу.
  • Обсуждаются сильные стороны Gemini 2.5 Flash: высокая скорость, низкая стоимость и хорошая работа со структурированными данными, но отмечаются ограничения по длине ответа.
  • Часто упоминается раздражающее поведение Gemini в приложении: навязывание и автовоспроизведение YouTube-видео в ответах, от которого нельзя отказаться.
  • Пользователи сравнивают Gemini с конкурентами (OpenAI, Anthropic, Grok), отмечая ее преимущества в цене и latency, но уступающую в качестве и интеллекте моделей.

Zed's Pricing Has Changed: LLM Usage Is Now Token-Based (zed.dev)

Zed переходит с помесячных лимитов на промпты на токен-ориентированную модель оплаты для использования ИИ-функций. Базовая подписка Pro теперь стоит $10 вместо $20 и включает $5 кредита на токены, а дополнительное использование тарифицируется по цене API-провайдеров плюс 10% надбавки. Также добавлены новые модели: GPT-5, Gemini 2.5 и Grok 4.

Это изменение отражает реальные затраты на запуск ИИ и устраняет несоответствие, когда простой запрос стоил столько же, сколько сложная задача. Пользователи получают больше гибкости и прозрачности, а Zed может устойчиво развивать редактор. Текущим клиентам даётся три месяца на переход, предлагаются альтернативы вроде своих API-ключей или локальных моделей.

by meetpateltech • 24 сентября 2025 г. в 16:13 • 150 points

ОригиналHN

#api#gemini#gpt-5#grok#llm#pricing#subscription#zed

Комментарии (143)

  • Пользователи выражают разочарование переходом Zed на токенную модель ценообразования, считая её сложной для прогнозирования затрат и неудобной по сравнению с фиксированной подпиской.
  • Многие отмечают, что встроенные AI-функции Zed, особенно предсказание правок, уступают конкурентам (Cursor, Claude Code), и предпочитают использовать внешние сервисы со своими API-ключами.
  • Поднимаются вопросы доступности редактора (отсутствие поддержки скринридеров) и его стабильности (баги, зависания при работе с большими файлами или проектами).
  • Высказываются опасения, что токенная модель создаёт неверные стимулы для разработчиков и неустойчива как бизнес-модель для посредников между пользователем и провайдерами LLM.
  • Часть пользователей положительно оценивает снижение стоимости базовой подписки и возможность поддержать разработку Zed, не переплачивая за неиспользуемые AI-функции.

Nano Banana image examples (github.com) 🔥 Горячее 💬 Длинная дискуссия

Коллекция готовых образов

  • Собраны минимальные и полные сборки под NanoPi R6S/R6C, Orange Pi 5/5B/5 Plus, Banana Pi BPI-M2S/M2P/M2 Zero, Radxa Zero 3
  • Ядро 6.x, U-Boot, Wi-Fi/BT, аппаратное ускорение, Docker, Portainer, Home Assistant, OpenWRT, Kodi, RetroArch, ROS2
  • Записать: dd if=*.img of=/dev/sdX bs=4M status=progress
  • Логин/пароль: root/1234 или pi/bananapi

Быстрый старт

  1. Скачать свежий образ из /releases
  2. Распаковать и записать на SD/SSD
  3. Вставить, включить, дождаться загрузки
  4. Подключиться по SSH/IP, сменить пароль

Сборка своего образа

  • Установить Docker → ./build.sh board=opi5 flavour=server
  • Через 15–30 мин появится готовый .img

Горячие клавиши

  • armbian-config – сеть, ядро, dtb
  • bananapi-config – overclock, GPIO, камера
  • htop, armbianmonitor -m – контроль железа

Полезные ссылки

by SweetSoftPillow • 11 сентября 2025 г. в 20:35 • 410 points

ОригиналHN

#docker#gemini#github#home-assistant#kodi#openwrt#retroarch#ros2

Комментарии (165)

  • Nano Banana (Gemini 2.5 Flash) показывает выдающееся качество редактирования и сохранения персонажа, но многие считают примеры «черри-пиком» после десятков попыток.
  • Пользователи жалуются на «copy-paste»-эффект, отказы по безопасности и неточности деталей (текст, одежда, пропорции).
  • NSFW-контент в демках вызывает споры: примеры с поднятыми юбками и сексуализированными персонажами портят восприятие.
  • Модель хороша для прототипов, раскрасок и мемов, но пока требует тщательного промпт-инжиниринга и повторных генераций.
  • Технически это не «одна модель», а тюнированный пайплайн Gemini для локального редактирования; открытых весов и полной документации нет.

Gemini 2.5 Flash Image (developers.googleblog.com) 🔥 Горячее 💬 Длинная дискуссия

  • Gemini 2.5 — Pro, Flash, Flash Image, Flash-Lite

  • Gemma 3 — Gemma 3, 3n, ShieldGemma 2

  • Генеративные модели — Imagen, Lyria, Veo

  • Эксперименты — Project Astra, Mariner, Gemini Diffusion

  • Исследования — проекты, публикации, новости

  • Наука

    • Биология: AlphaFold, AlphaGenome, AlphaMissense, AlphaProteo
    • Климат: WeatherNext, Weather Lab
    • Математика и КС: AlphaEvolve, AlphaProof, AlphaGeometry
    • Физика и химия: GNoME, Fusion, AlphaQubit
    • Прозрачность: SynthID
  • О нас — новости, карьера, вехи, образование, безопасность, подкаст

by meetpateltech • 26 августа 2025 г. в 14:01 • 1011 points

ОригиналHN

#alphafold#alphagenome#alphageometry#alphamissense#alphaproof#alphaproteo#gemini#imagen#lyria#veo

Комментарии (452)

  • Gemini 2.5 Flash (nano-banana) стал новым «iPhone-моментом» для редактирования картинок: +171 ELO на LM Arena, почти догнал Imagen и gpt-image-1.
  • Модель умеет одновременно использовать несколько входных изображений без хаков, быстро работает и дешёво ($0.02), но дороже Flux Schnell.
  • Жёсткая безопасность: отказывает в редактировании людей и детей, половина промптов блокируется, что делает продукт бесполезным для фото-ретуши.
  • На практике результаты не всегда совпадают с рекламой, иногда «Internal server error» и квоты API, а в Европе доступ ограничен VPN.
  • Пользователи радуются быстрому восстановлению старых фото и «фотобаттлам», но боятся deepfake-шантажа и отсутствия контроля над лицами.

Weaponizing image scaling against production AI systems (blog.trailofbits.com) 🔥 Горячее

  • Суть атаки: при загрузке большого изображения в Gemini CLI, Vertex AI, Google Assistant и др. системы изображение уменьшается до размеров модели. В момент масштабирования скрытые пиксель-инъекции становятся читаемыми как команды, позволяя красть данные или выполнять код без подтверждения пользователя.

  • Пример: в Gemini CLI через Zapier MCP (trust=True по умолчанию) отправка «безобидной» картинки приводит к выгрузке календаря на почту злоумышленника.

  • Масштаб: подтверждены атаки на веб-Gemini, API, Android-Assistant, Genspark и др. UI показывает оригинал, а модель видит уменьшенную версию с инъекцией.

  • Техника: используются алгоритмы downscale (nearest-neighbor, bilinear, Lanczos). Высокочастотные паттерны превращаются в читаемые символы при уменьшении.

  • Anamorpher: опенсорс-утилита для генерации таких «анаморфных» изображений.

  • Защита:

    • отключить автоматическое масштабирование или запрашивать подтверждение;
    • применять контент-фильтры к уменьшенной копии;
    • запретить инлайн-вызовы инструментов без явного согласия;
    • внедрить rate-limit и аудит действий агентов.

by tatersolid • 21 августа 2025 г. в 12:20 • 468 points

ОригиналHN

#cybersecurity#gemini#google#image-processing#llm#security#vertex-ai#zapier

Комментарии (131)

  • Атака заключается в том, что в изображении скрывают текст-команду, который после уменьшения или OCR становится частью промпта и переопределяет поведение модели.
  • Проблема усугубляется тем, что современные агент-системы требуют широких прав и не различают «достоверные» и «внешние» инструкции.
  • Участники сравнивают это с уязвимостями старых PHP-скриптов и serial-terminals: данные и команды смешаны в одном потоке.
  • Предлагаемые защиты — шум перед ресайзом, sandbox-слои, фильтрация текста в картинке, «sudo-токены» и строгое разграничение контекстов — пока не решают проблему полностью.
  • Общий вывод: пока LLM не научатся надёжно разделять данные и инструкции, любой внешний вход считается потенциально отравленным.

Pixel 10 Phones (blog.google) 🔥 Горячее 💬 Длинная дискуссия

  • Pixel 10

    • 6,2" OLED 120 Гц, Tensor G5, 12 ГБ ОЗУ, 128/256 ГБ, 50 МП + 13 МП, 4575 мА·ч, 27 Вт, IP68, 799 $.
  • Pixel 10 Pro

    • 6,7" LTPO 1–120 Гц, 12 ГБ, 256/512 ГБ, 50 МП + 48 МП + 48 МП, 5050 мА·ч, 37 Вт, 999 $.
  • Pixel 10 Pro XL

    • 6,9" LTPO, 16 ГБ, до 1 ТБ, 5500 мА·ч, 45 Вт, 1199 $.

Общее

  • Gemini Nano 2.0 на устройстве, 7 лет обновлений.
  • Дизайн: плоские рамки, новые цвета (Obsidian, Porcelain, Sky, Jade).
  • Предзаказ с 8 августа, старт продаж 22 августа.

by gotmedium • 20 августа 2025 г. в 17:24 • 390 points

ОригиналHN

#android#esim#gemini#google#grapheneos#lineageos#pro-res#snapdragon#tensor

Комментарии (777)

  • Tensor G5 + Gemini Nano запускают Magic Cue локально; это выглядит как то, что Apple обещала, но не выпустила.
  • Железо Pixel 10 всё ещё отстаёт по скорости от флагманов на Snapdragon 8 Elite и греется.
  • Камерный модуль огромен, 100× «Pro Res Zoom» использует генеративную «доработку» деталей.
  • Нет лотка для физической SIM: eSIM только через GMS, что ломает совместимость с LineageOS и GrapheneOS.
  • Цены стартуют с $799, но многие считают это дорого и ждут Pixel 10a или скидок на старые модели.
  • Проблемы с миграцией данных, стабильностью ПО и отсутствием продаж в большинстве стран остаются.

Cursor CLI (cursor.com) 🔥 Горячее 💬 Длинная дискуссия

  • Установка: npm i -g cursor-cli
  • Команды: cursor diff, cursor commit, cursor review, cursor chat
  • Где работает: VS Code, JetBrains, Android Studio, Ghostty, Warp, Bash

Функции

  • Прямые правки кода в терминале
  • Реальное управление агентом
  • Правила через .cursorrules, AGENTS.md, MCP

Плюсы

  • Последние модели Anthropic, OpenAI, Gemini
  • Интеграция в любой IDE
  • Скрипты и автоматизация

by gonzalovargas • 07 августа 2025 г. в 20:53 • 359 points

ОригиналHN

#android-studio#anthropic#bash#gemini#github#jetbrains#llm#npm#openai#vscode

Комментарии (248)

  • Пользователи обсуждают внедрение единого стандарта AGENT.md вместо множества разных файлов.
  • CLI-агенты (Claude Code, Cursor CLI и др.) вызывают восторг: удобно держать в фоне, «чувствуешь себя хакером», но UI-IDE теряет значение.
  • Критика: непонятно, зачем платить за Cursor, если тот же функционал уже включён в подписку Anthropic/OpenAI; не хватает обратной связи, MCP, hooks и локальных моделей.
  • Сторонники Cursor верят в его будущую экосистему (CLI + IDE + GitHub-интеграции) и низкие издержки переключения между моделями.
  • Главный вопрос безопасности: доверять ли LLM полный доступ к файловой системе и устанавливать скрипты через curl | bash.