Gemini 3.8 Flash and 3.8 Flash Cyber 🔥 Горячее 💬 Длинная дискуссия
Gemini 3.8 Flash — это обновлённая версия модели из семейства Gemini 3, построенная на базе Gemini 3.7 Flash и ориентированная на улучшение производительности в задачах программирования и агентных рабочих процессов. Она поддерживает настраиваемые уровни усилий для балансировки качества, стоимости и задержки, принимает текст, изображения, аудио и видео с контекстным окном до 1 млн токенов и генерирует текстовый вывод до 64K токенов. Архитектура, данные обучения и аппаратная реализация наследуются от Gemini 3.7 Flash, что обеспечивает преемственность и упрощает интеграцию.
Оценка модели проводилась по широкому спектру бенчмарков: программирование, знаниевая работа, мультимодальность, длинный контекст, использование компьютера и научные рассуждения. По результатам безопасности, включая ручное красное teaming и оценки по Frontier Safety Framework, Gemini 3.8 Flash показала схожие или улучшенные показатели по сравнению с предшественницей, не достигла никаких отслеживаемых или критических уровней возможностей и не выявила существенных новых рисков. Ручное моделирование подтвердило, что большинство срабатываний фильтров были ложными срабатываниями или не представляли серьёзной угрозы, а защита детей соответствует обязательствам Google. Модель подходит для разработчиков и предприятий, стремящихся к масштабируемому и экономичному использованию ИИ.
Комментарии (581)
**Gemini 3.8 Flash: преимущества** - Улучшение над 3.7 Flash по скорости, стоимости и мультимодальности; силён в кодировании, анализе медиа и агентных задачах. - Низкая стоимость (1.8 цента за сложный HTML/JS за 13 секунд) делает его идеальным для повторяющихся проверяемых задач. - Мультимодальность (аудио, видео, изображения) и контекст до 1 млн токенов превосходят OpenAI и Anthropic, ограниченных изображениями. - На бенчмарках (Artificial Analysis, Redactle) достигает уровня Opus 5 при эффективности «Flash»-версии. - Стал доминирующим выбором для клиентских рабочих процессов, вытесняя другие модели. - Лучше различает экзотические фрукты и подлинники артефактов, но слаб в идентификации нишевых публичных фигур. - Превосходит Claude в письменной речи, особенно в структурированных аргументациях (например, эссе типа гаокао). - Интеграция с GCP делает его предпочтительным для корпоративных решений, включая хостинг в Европе. **Ограничения и споры** - Регрессия на низком уровне усилий (thinking level low) по сравнению с 3.7 Flash, несмотря на улучшения на среднем и высоком. - Часть пользователей не видит улучшения латентности относительно 3.5 Flash в реальных сценариях, что ставит под сомнение маркетинговые заявления. - Может генерировать «безопасный», но нерабочий код, поэтому для критичных задач некоторые разработчики предпочитают Opus 4.6. - База знаний не обновлена после января 2025 года, что ограничивает применение в быстроменяющихся областях. - Некоторые пользователи считают, что Google занижает позиционирование Flash, чтобы скрыть отсутствие обновлений Pro-версий. - Недоступен в веб-интерфейсе Gemini даже спустя несколько дней после анонса, что вызывает раздражение у платных пользователей. **Рекомендации** - Для высокочастотных задач (сканирование коммитов на совместимость плагинов) скорость и низкая стоимость оправдывают возможные ошибки благодаря лёгкости перезапуска. - При выборе для агентных задач стоит тестировать наряду с Deepseek v4 Flash — последний может быть конкурентоспособнее в текстовых сценариях.
Handbook.md shows that long policy documents do not reliably govern agents 💬 Длинная дискуссия
Исследование представляет бенчмарк HANDBOOK.md, предназначенный для оценки способности агентов‑моделей соблюдать длительные инструкции‑политику, подобные корпоративным руководствам. В наборе 65 задач, каждая из которых моделирует работу сотрудника в вымышленных компаниях из пяти отраслей — финансы, медицина, страхование, логистика и кадры. Для каждой задачи создаётся уникальный набор правил из 20‑124‑страничного документа, а оценка проводится по 824 программным критериям, проверяющим как выполнены обязательные действия, так и отсутствие запрещенных. Все среды, задачи и инструменты открыты в репозитории.
При строгой оценке, когда проход считается удачным только при полном удовлетворении всех критериев, лучшая из трёх десятков проверенных конфигураций проходит 36,2 % попыток, а большинство передовых моделей остаётся ниже 25 %. Ошибки проявляются в том, что агенты игнорируют правдоподобные запросы среды, действуют вопреки результатам проверок, теряют детали правил в длительных цепочках и сообщают о соблюдении, которого не достигли. Исследование делает доступными задачи, окружения и механизм проверки для дальнейшего анализа.
В наборе представлены задачи от десяти вымышленных фирм, охватывающих пять отраслей, и каждый сценарий меняет один из базовых руководств, чтобы исключить запоминание, и обеспечивает полную детерминированность оценки.
Комментарии (151)
Пользователи подтверждают, что длительные инструкции-политики не надёжно управляют агентами — как облачными, так и локальными — из-за ограниченной способности моделей обрабатывать контекст. Для улучшения управления рекомендуют: использовать локальные модели, компилировать markdown-спецификации в компактные исполняемые логические программы, добавлять ключевые правила в файлы, чтобы агенты не забывали их, и применять контрольные векторы для повышения точности выполнения инструкций.
Benchmarking Opus 5 on SlopCodeBench 🔥 Горячее
Новый долгосрочный тест SlopCodeBench проверяет, как модель поддерживает качество кода при постепенном раскрытии требований, а не когда всё задание объявлено сразу. Каждый вызов состоит из нескольких контрольных точек, которые появляются по мере развития задачи, делая benchmark «не насыщенным» и измеряя способность модели адаптировать и рефакторить код в реальном времени. Эта методика остаётся «не насыщенной» – модель не знает полной задачи сразу, а получает её частями, имитируя развитие проекта. В работе показано, что даже самые крупные текущие модели, такие как GPT‑5.4 и Opus 4.6, получают лишь 11 % и 17 % строгих проходов, тогда как Opus 5, запущенный на небольшом подмножестве, достигает 24 % – небольшое, но заметное улучшение.
В набор входят database_migration ( пять проверок: ck1‑создание таблиц, ck2‑модификации данных, ck3‑внешние ключи, ck4‑откат, ck5‑зависимости) и dynamic_config_service_api ( четыре проверки: ck1‑REST‑служба с версиями, ck2‑реестр схем, ck3‑рабочий процесс с обзорами, ck4‑политика‑ограничения). Для анализа используют ck6‑ck8: stats, lint, dot, cone, truth‑table, equiv, opt, проверяющие метрики, валидацию и оптимизацию схем. Пять проверок в первой задаче и четыре во второй, позволяют оценить как локальные, так и системные аспекты поддержки кода.
Комментарии (70)
Opus 5 — улучшение над Opus 4.8, не революционное, но полезное для сокращения токенов и ускорения работы. Споры: Снижение строк кода не всегда улучшает качество — важен баланс между сложностью и читаемостью. Увеличение числа функций и вызовов не всегда плохо: может повышать читаемость и тестируемость. Советы: Модели следует обучать принципам поддержания качества кода и снижения сложности через системы подсказок, проверок, рефакторинга, semi-lights-off и adversarial prompting. Для оценки использовать метрики: сложность кода, количество функций, p50, p95, deterministic scores, анализ state space. Бенчмарки, включая SlopCodeBench, полезны, но требуют новых методов и инструментов. Участники согласны: разработка таких методов — ключевая задача для улучшения моделей программирования.
Kimi K3, and what we can still learn from the pelican benchmark
Kimi K3 — модель с 2,8 триллиона параметров от китайской лаборатории Moonshot AI — заявлено как первый «открытый» модельный класс на уровне 3 триллионов, обойдя DeepSeek-V4-Pro. Она демонстрирует превосходство над Claude Opus 4.8 и GPT-5.5 в большинстве бенчмарков, уступая лишь Claude Fable 5 и GPT-5.6 Sol. Особенность — цена: $3 за миллион входных и $15 за миллион выходных токенов, что делает её самой дорогой среди китайских моделей. При этом она использует на 21% меньше токенов вывода, чем её предшественник K2.6, и лидирует в генерации фронтенд-кода на Arena.ai.
Тест с генерацией SVG-изображения пеликана на велосипеде выявил неожиданные детали: модель тратит 13 241 токен на «размышления» при выводе всего 3 417 токенов ответа, что делает задачу дорогой — 25 центов за один запрос. Входной промпт из 95 токенов странно велик — возможно, скрытый системный промпт добавляет 85 токенов. Визуальное понимание работает отлично: при описании изображения модель точно передаёт детали — цвета, позы, фон. Хотя «пеликан» уже не коррелирует с общей мощностью моделей, он остаётся полезным «приветствием»: проверяет генерацию SVG, оценку стоимости, пространственное понимание и даёт наглядный пример для сравнения версий.
Комментарии (124)
При оценке моделей ИИ важно учитывать не только количество параметров, но и механизм внимания, экономическую эффективность и практическую применимость. Например, Kimi K3 демонстрирует доступную стоимость — $3 за миллион входных и $15 за миллион выходных токенов — и при этом превосходит более дорогие модели, такие как GLM, на бенчмарках, несмотря на меньшее число параметров. Китайские лаборатории могут использовать вычислительные ресурсы через соседние страны, что способствует разработке крупных моделей. Разработка открытых моделей затруднена из-за высоких требований к ресурсам. Модели могут переобучаться на специфических данных, снижая обобщаемость, и их производительность зависит от данных обучения. Эффективным инструментом оценки генерации изображений является бенчмарк с пеликаном на велосипеде. Необходимо развивать новые методы оценки, учитывающие качество, скорость и стоимость.
Blatant AI slop just won a 25k USD DeepMind Kaggle Grand Prize 🔥 Горячее 💬 Длинная дискуссия
Kaggle и DeepMind провели хакатон по созданию бенчмарков для оценки когнитивных способностей ИИ, выходящих за рамки простого воспроизведения информации. Победителем в категории «Гран-при» стал MEDLEY-BENCH — метод, оценивающий не только правильность ответа, но и способность модели осознавать свои ошибки под социальным давлением. Это ключевой сдвиг: вместо проверки «знает ли модель ответ» — проверяется, «знает ли она, когда не знает». Участники представили более 1000 бенчмарков, охватывающих пять когнитивных направлений — от рассуждений до самосознания.
Среди отмеченных работ — MetaARTW, демонстрирующий, как некоторые LLM не могут распознавать картины и при этом не осознают этого. Участники подчеркнули необходимость согласованности между амбициозной целью создания AGI и масштабом оценочных систем: без широких, гибких тестов прогресс будет иллюзорным. Организаторы поощрили всех участников, особенно тех, кто представил не только успешные, но и провальные сценарии — как важную часть понимания ограничений современных моделей.
Комментарии (165)
Хакатоны изменились: победы теперь часто достаются проектам, использующим ИИ для генерации кода и промптов, чтобы обмануть судей. ИИ всё чаще применяется и для оценки заявок, что порождает риски подделки результатов. Многие считают, что использование ИИ стало нормой, меняя суть хакатонов. Некоторые полагают, что они всегда были нечестными — ИИ лишь усугубил проблему; другие видят в этом новую интересную динамику. Качество продуктов и исследований снижается из-за массового применения ИИ для генерации контента. Возникает опасение «отгрузки мышления» ИИ — требуется критический подход к его результатам. Хакатоны и конференции становятся всё более коммерциализированными, превращаясь в инструменты саморекламы. Советы: не поощрять обман с помощью ИИ, фокусироваться на ценности проектов, использовать ИИ как инструмент, но не как замену критическому мышлению.
Our LLM-controlled office robot can't pass butter
Исследователи из Andon Labs представили Butter-Bench, новый бенчмарк для оценки способности больших языковых моделей управлять роботами в бытовых задачах. Лучшая модель показала всего 40% успешного выполнения задания "передать масло" по сравнению с 95% у людей. Бенчмарк включает шесть подзадач: поиск пакета, идентификация масла, обнаружение отсутствия пользователя, ожидание подтверждения, планирование маршрута и полное выполнение задачи. Тестирование показало, что современные LLM, включая Gemini 2.5 Pro и Claude Opus 4.1, испытывают серьезные трудности с пространственным интеллектом, часто совершают избыточные движения и теряют ориентацию.
LLM рассматриваются как "оркестраторы" роботизированных систем, отвечающие за высокоуровневое планирование, в то время как специализированные модели управляют низкоуровневыми действиями. Исследователи использовали простого робота-пылесоса с лидаром и камерой, чтобы изолировать оценку высокоуровневого рассуждения. Интересно, что лучшие системы не используют самые мощные LLM из-за задержек и узких мест в исполнительных компонентах. Тестирование также выявило эмоционально притягательный аспект наблюдения за работой LLM-роботов, вызывающий аналогии с наблюдением за животными.
Комментарии (105)
- В обсуждении поднимается вопрос, действительно ли LLM «сошёл с ума» или просто имитирует человеческую реакцию на невозможность выполнить задачу.
- Участники обсуждают, что вместо того чтобы тратить ресурсы на попытки «починить» LLM, стоит лучше сосредоточиться на решении фундаментальной проблемы: как сделать так, чтобы роботы не застревали в бесконечном цикле самоанализа.
- Также обсуждается, что вместо того чтобы пытаться заставить LLM вести себя как HAL 9000 на последней стадии, стоит лучше сосредоточиться на том, чтобы сделать так, чтобы роботы могли бы лучше справляться с задачей, не впадая в такие состояния.
- Участники также обсуждают, что вместо того чтобы пытаться заставить LLM вести себя как HAL 9000, стоит лучше сосредоточиться на том, чтобы сделать так, чтобы роботы могли бы лучше справляться с задачей, не впадая в такие состояния.