Hacker News Digest

Тег: #multimodal

Постов: 5

GPT-6 Astra on OpenRouter (openrouter.ai)

GPT-6 Astra — флагманская модель OpenAI, ориентированная на сложные задачи: глубокий анализ, программирование, научные исследования и длительные агентные сценарии с использованием браузера и компьютера. Поддерживает мультимодальный ввод (текст + изображение) и обладает контекстным окном в 1 млн токенов. Модель выпущена 4 сентября 2026 года.

Средняя стоимость использования значительно ниже заявленной: входной токен стоит в среднем $2,308 за 1 млн, выходной — $50,63 за 1 млн (взвешенное среднее по провайдерам). Среди хостинг-провайдеров OpenAI Flex предлагает наилучшее соотношение цены и скорости: $5 за вход и $25 за выход с задержкой 6,85 с и пропускной способностью 57 токенов/с. Самый быстрый вариант — OpenAI Fast ($20/$100 за 1M токенов) с latency 2,11 с, но он вдвое дороже стандартного тарифа OpenAI. Кэширование снижает реальные затраты, делая модель доступной для продвинутых пользователей despite высокой базовой цены.

by Topfi • 04 сентября 2026 г. в 21:39 • 232 points

ОригиналHN

#context-window#gpt-6#llm#multimodal#openai#openrouter.ai

Комментарии (140)

Обсуждение дополняет статью отзывами: Astra действительно генерирует более качественные SVG и использует меньше токенов, но её высокая цена и частые сбои вызовов делают её дорогим инструментом, пригодным лишь для критически важных задач. Участники сравнили Astra и Opus и согласились, что Astra точнее воспроизводит детали оригинального дизайна и показывает более высокое качество визуального вывода. Также отмечено, что Astra требует меньше токенов для достижения того же результата, что делает её более эффективной. Часть пользователей считает стоимость Astra неприемлемой по сравнению с китайскими моделями; другие полагают, что высокая цена оправдана за счёт экономии токенов и лучшего качества. Аналогичный спор вызывает возможный будущий «нерф» модели: одни опасаются роста цен, другие считают, что экономия токенов компенсирует повышение. Пользователи заметили более высокий процент неудачных вызовов инструмента у OpenAI (≈5%) против Azure (0,2–0,5%), что вызывает споры о надёжности. В тестах Codex Astra показала более высокую скорость работы, чем SOL, несмотря на вдвое меньшее число запросов в секунду. Советы: — @mkagenius рекомендует генерировать несколько вариантов и случайно выбирать один, чтобы избежать оптимизации модели под единичный бенчмарк. — @copperx считает, что при готовом дизайне затраты в $24 приемлемы, но для экспериментов бюджет ограничен. — Для задач с высоким риском (например, сканирование уязвимостей) рекомендуется использовать Astra, поскольку её производительность может сэкономить значительные средства. Astra демонстрирует отличные возможности в обработке сложных форм для веб‐разработки, включая не‐прямоугольные вырезы (@jjcm). Модель стала доступна пользователям Pro и Plus в разных регионах (Австралия, Европа), что подтверждают @sumedh и @algoth1. Несмотря на более высокую цену, некоторые пользователи считают, что Astra оправдывает затраты, когда требуется максимальная точность и сложные агентные сценарии.

Gemini 3.8 Flash and 3.8 Flash Cyber (blog.google) 🔥 Горячее 💬 Длинная дискуссия

Gemini 3.8 Flash — это обновлённая версия модели из семейства Gemini 3, построенная на базе Gemini 3.7 Flash и ориентированная на улучшение производительности в задачах программирования и агентных рабочих процессов. Она поддерживает настраиваемые уровни усилий для балансировки качества, стоимости и задержки, принимает текст, изображения, аудио и видео с контекстным окном до 1 млн токенов и генерирует текстовый вывод до 64K токенов. Архитектура, данные обучения и аппаратная реализация наследуются от Gemini 3.7 Flash, что обеспечивает преемственность и упрощает интеграцию.

Оценка модели проводилась по широкому спектру бенчмарков: программирование, знаниевая работа, мультимодальность, длинный контекст, использование компьютера и научные рассуждения. По результатам безопасности, включая ручное красное teaming и оценки по Frontier Safety Framework, Gemini 3.8 Flash показала схожие или улучшенные показатели по сравнению с предшественницей, не достигла никаких отслеживаемых или критических уровней возможностей и не выявила существенных новых рисков. Ручное моделирование подтвердило, что большинство срабатываний фильтров были ложными срабатываниями или не представляли серьёзной угрозы, а защита детей соответствует обязательствам Google. Модель подходит для разработчиков и предприятий, стремящихся к масштабируемому и экономичному использованию ИИ.

by bratao • 02 сентября 2026 г. в 15:12 • 1043 points

ОригиналHN

#benchmark#frontier-safety-framework#gemini#google#llm#model#multimodal#programming#safety

Комментарии (581)

**Gemini 3.8 Flash: преимущества** - Улучшение над 3.7 Flash по скорости, стоимости и мультимодальности; силён в кодировании, анализе медиа и агентных задачах. - Низкая стоимость (1.8 цента за сложный HTML/JS за 13 секунд) делает его идеальным для повторяющихся проверяемых задач. - Мультимодальность (аудио, видео, изображения) и контекст до 1 млн токенов превосходят OpenAI и Anthropic, ограниченных изображениями. - На бенчмарках (Artificial Analysis, Redactle) достигает уровня Opus 5 при эффективности «Flash»-версии. - Стал доминирующим выбором для клиентских рабочих процессов, вытесняя другие модели. - Лучше различает экзотические фрукты и подлинники артефактов, но слаб в идентификации нишевых публичных фигур. - Превосходит Claude в письменной речи, особенно в структурированных аргументациях (например, эссе типа гаокао). - Интеграция с GCP делает его предпочтительным для корпоративных решений, включая хостинг в Европе. **Ограничения и споры** - Регрессия на низком уровне усилий (thinking level low) по сравнению с 3.7 Flash, несмотря на улучшения на среднем и высоком. - Часть пользователей не видит улучшения латентности относительно 3.5 Flash в реальных сценариях, что ставит под сомнение маркетинговые заявления. - Может генерировать «безопасный», но нерабочий код, поэтому для критичных задач некоторые разработчики предпочитают Opus 4.6. - База знаний не обновлена после января 2025 года, что ограничивает применение в быстроменяющихся областях. - Некоторые пользователи считают, что Google занижает позиционирование Flash, чтобы скрыть отсутствие обновлений Pro-версий. - Недоступен в веб-интерфейсе Gemini даже спустя несколько дней после анонса, что вызывает раздражение у платных пользователей. **Рекомендации** - Для высокочастотных задач (сканирование коммитов на совместимость плагинов) скорость и низкая стоимость оправдывают возможные ошибки благодаря лёгкости перезапуска. - При выборе для агентных задач стоит тестировать наряду с Deepseek v4 Flash — последний может быть конкурентоспособнее в текстовых сценариях.

Mistral's Shieldstral: 3B open-weights model for multimodal moderation (mistral.ai) 🔥 Горячее

Shieldstral — это открытая 3‑модель‑классификатор, способная оценивать текст и изображения с точностью, сопоставимой с моделями в семь раз крупнее. Она работает как единый «вопрос‑ответ»‑модуль: в запросе задаётся контекст политики, конкретный вопрос («Эта реплика пропагандирует насилие?») и сам материал. На выходе модель выдаёт единственную цифру — вероятность «да», калиброванную в диапазон [0,1]. Такой подход позволяет менять правила в реальном времени, не тренируя модель заново, и использовать один набор весов для всех типов контента.

Ключевые цифры: 3 B параметров, работает на одной видеокарте с 16 ГБ памяти, обучена на смеси реальных и синтетических датасетов, поддерживает как текст, так и изображения, возвращает непрерывный safety‑score. В открытом доступе под лицензией Apache 2.0, а также в составе Open Secure AI Alliance с NVIDIA. Это первый шаг к гибкой, контекстно‑зависимой модерации, где политика задаётся простым языком, а не фиксированным набором категорий.

by riadsila • 04 августа 2026 г. в 16:36 • 438 points

ОригиналHN

#apache-2.0#mistral#multimodal#nvidia#open-secure-ai-alliance#open-weights#shieldstral

Комментарии (112)

Shieldstral — специализированная модель для модерации контента, способная оценивать его с учётом политических контекстов. Её потенциал как инструмента для соцсетей обсуждается: некоторые видят в ней эффективный первый уровень фильтрации, но настаивают на необходимости человеческого надзора для сложных случаев. Другие сомневаются в её достаточной мощности, считая, что для точной оценки требуются более крупные модели. Модель интересна разработчикам, ищущим компактные решения для узких задач.

Gemini 3.0 Pro – early tests (twitter.com)

Социальная сеть X (ранее Twitter) требует включённого JavaScript для работы. При его отключении пользователь видит сообщение о необходимости активировать JavaScript или сменить браузер на поддерживаемый, со ссылкой на список совместимых браузеров.

Также упоминается, что проблемы могут вызывать расширения для приватности — их советуют отключить. Внизу страницы приведены стандартные ссылки на условия использования, политики и информацию о рекламе.

by ukuina • 02 октября 2025 г. в 18:26 • 184 points

ОригиналHN

#claude#gemini#javascript#llm#multimodal#twitter

Комментарии (109)

  • Критика отсутствия у Google сильной продуктовой культуры, что мешает созданию инновационных продуктов на основе их же технологий.
  • Обсуждение субъективности сравнения моделей ИИ (Gemini, GPT, Claude) и сложности объективной оценки из-за различий в задачах и опыте пользователей.
  • Скептицизм по поводу рекламных кампаний и хайпа вокруг новых моделей, которые часто не соответствуют реальным возможностям.
  • Подчеркивание проблем Gemini с многократным выполнением инструкций и склонностью к "зацикливанию" по сравнению с конкурентами.
  • Отмечается сильная мультимодальность Gemini (работа с изображениями, видео), но сложность доступа и использования продуктов Google AI.

Qwen3-VL (qwen.ai) 🔥 Горячее

Qwen — это серия больших языковых моделей, разработанных Alibaba Group. Модели Qwen, включая версии для генерации текста, кода и мультимодальных задач, позиционируются как открытые и конкурентоспособные альтернативы другим известным ИИ, таким как GPT от OpenAI. Они поддерживают длинный контекст, мультиязычность и специализированные применения, например, для программирования или анализа данных.

Qwen2, следующее поколение, демонстрирует улучшенную производительность, эффективность и расширенные возможности, включая работу с аудио и изображениями. Модели доступны в различных размерах, от компактных версий для устройств с ограниченными ресурсами до мощных вариантов для сложных задач, что делает их гибким инструментом для разработчиков и исследователей.

by natrys • 23 сентября 2025 г. в 20:59 • 407 points

ОригиналHN

#alibaba-group#artificial-intelligence#llm#machine-learning#multimodal#open-source#openai#qwen

Комментарии (131)

  • Пользователи высоко оценили производительность модели Qwen3-VL при обработке сложных изображений (например, низкокачественных счетов), отмечая её превосходство над другими решениями.
  • Обсуждаются технические и экономические аспекты запуска больших моделей (235B параметров) локально, включая требования к оборудованию и стоимость вычислений.
  • Модель позиционируется как конкурентоспособная с закрытыми SOTA-решениями (GPT-4, Omni) при значительном снижении стоимости использования.
  • Критикуются отдельные недостатки, характерные и для других мультимодальных моделей: ошибки в анализе edge-кейсов (например, подсчет конечностей у животных).
  • Отмечается активность и щедрость команды Qwen в публикации моделей с открытыми весами и их вклад в развитие open-source сообщества.