Hacker News Digest

Тег: #claude-opus-5

Постов: 3

Quasar 438B: Europe's Leading AI Model (multiversecomputing.com)

Quasar 438B — это флагманская модель Multiverse Computing, первая крупномасштабная ИИ-модель компании, ориентированная на корпоративные агенты и программирование. Она работает на английском и испанском языках и набрала 43 балла в индексе Artificial Analysis Intelligence Index v4.1.1 — лучший результат среди европейских моделей. Индекс объединяет девять тестов, включая GDPval-AA, τ³-Banking, Terminal-Bench, SciCode и другие. Quasar опережает Mistral Medium 3.5 (30 баллов), NVIDIA Nemotron 3 Ultra (38) и Inkling (42), уступая только лидерам вроде Claude Opus 5 (63).

Помимо высокой точности, модель демонстрирует выдающуюся скорость: генерация 500 токенов с учётом времени рассуждения занимает всего 15,3 секунды. Это быстрее, чем у большинства конкурентов — только три модели отвечают быстрее, и лишь одна из них (Gemini 3.7 Flash) превосходит Quasar по интеллекту. По сравнению с Mistral Medium 3.5, Quasar не только точнее (43 против 30), но и быстрее (15,3 с против 18,8 с). В долгосрочном контексте (AA-LCR) модель набрала 75,0 балла — на уровне Grok 4.6 и близко к Claude Opus 5 (75,7), превосходя Nemotron 3 Ultra на 4,0 и Mistral на 9,7 пунктов. На Terminal-Bench v2.1 Quasar набрал 69,3, опережая Mistral на 18,7 и Nemotron на 15,4 балла, что подтверждает её силу в агентном программировании и работе с терминалом. Модель доступна через API CompactifAI без необходимости развёртывания собственной инфраструктуры.

by amunozo • 02 сентября 2026 г. в 10:02 • 167 points

ОригиналHN

#anthropic#claude-opus-5#gemini#llm#mistral#multiverse-computing#nvidia#quasar-438b

Комментарии (106)

Обсуждение ставит под сомнение оригинальность и превосходство Quasar 438B: ряд комментаторов (walrus01, comandillos, fantyoon, espadrine) считают её дообученной китайской моделью (GLM-5.2, Qwen, Nemotron). scrollaway, ссылаясь на личную встречу с CEO и участие в EIC Accelerator, указывает на реальный продукт и финансирование. Большинство сходится в том, что закрытые веса делают бенчмарки недостоверными, а модель при этом уступает Qwen-3.8-27B почти впятеро меньшей по размеру. Заявления о квантовом сжатии (80–95 % без потери точности) воспринимаются как маркетинговый шум без подтверждений. Часть участников (DeathArrow, torginus) отмечает непрозрачность финансирования и руководства, подозревая использование грантов без достаточной технологической базы. Титул «Europe's Leading AI Model» считается низким порогом — модель уступает более сильным китайским и американским LLM. Рекомендации: открыть веса или предоставить воспроизводимые протоколы бенчмаркинга; интеграция в OpenRouter повысит доступность; модель может найти нишу в европейском суверенитете данных, если будет соответствовать EU-AI-Act и размещаться в ЕС; избегать преувеличенных формулировок и оценивать модели по реальным метрикам, а не по слоганам. Сообщество хочет видеть открытые европейские альтернативы китайским моделям (Mistral, Laguna) и рассматривает проект как потенциального конкурента в этом направлении.

Auto mode is now the default in Claude Code (claude.com) 💬 Длинная дискуссия

Авторежим стал настройкой по умолчанию для пользователей Pro, Max и Team‑планов. Начиная с 14 августа новые сессии автоматически работают в этом режиме, а те, у кого был собственный выбор, получат одноразовый запрос на переключение. Если админ уже зафиксировал другой режим в управляемых настройках, ничего не меняется.

Классификатор, отвечающий за блокировку опасных действий, потребляет лишь несколько дополнительных токенов, но теперь его использование не тарифицируется для указанных тарифов. В Enterprise‑режиме авторежим пока остаётся опциональным, однако уже в ближайший месяц он станет обязательным и во всех облачных платформах (AWS, Google Cloud, Microsoft Foundry и др.).

По данным внутренних и сторонних тестов, авторежим не ухудшает безопасность: он блокирует необратимые, разрушительные или внешне‑ориентированные вызовы, а при трёх последовательных блокировках или 20‑ти блокировках за сессию переходит к ручному подтверждению. В эксперименте с 1 053 платёжными тестировщиками авторежим показал результаты, сопоставимые или лучше, чем ручной обзор.

Кроме того, авторежим позволяет моделям типа Claude Opus 5 выполнять длительные задачи без постоянных вмешательств. Пользователи Teams и Enterprise‑пользователи, включившие авторежим, генерируют на 25 % больше pull‑request’ов. Примеры внедрения: Adobe, Nuro, Gusto, Garner Health.

Что нужно знать:

  • В Pro/Max/Team‑режимах авторежим включён автоматически; переключить его можно через Shift+Tab или выпадающий список в десктоп‑клиенте.
  • Для Enterprise‑администраторов доступна настройка `defaultMode` в управляемых параметрах.
  • При критических изменениях в продакшене рекомендуется проверять действия модели вручную.

Таким образом, авторежим упрощает работу, повышает производительность и сохраняет уровень безопасности, сравнимый с ручным обзором.

by sbehere • 10 августа 2026 г. в 03:50 • 173 points

ОригиналHN

#auto-mode#aws#claude#claude-opus-5#enterprise-plan#google-cloud#max-plan#microsoft-foundry#pro-plan#team-plan

Комментарии (159)

Пользователи против включения авто-режима по умолчанию, считая его ненадёжным для предотвращения опасных действий и требуя ручного контроля. Классификатор безопасности часто ложно срабатывает, блокируя безобидные команды, что вызывает неудобства. Некоторые допускают пользу авто-режима в мелких проектах, но настаивают на его отключении для сложных задач. Рекомендуют применять песочницы и другие меры безопасности при использовании LLM без надлежащего контроля.

Claude Opus 5 (anthropic.com) 🔥 Горячее 💬 Длинная дискуссия

Claude Opus 5 — новая модель, доступная сегодня, сочетающая продвинутый, проактивный подход с почти границей интеллекта Claude Fable 5, но по цене в половину дешевле. На Benchmarks Frontier‑Bench v0.1 и CursorBench 3.2 она превосходит все остальные модели, удваивая результат Opus 4.8 при том же стоимости; на ARC‑AGI 3 её score в три раза выше следующей; на Zapier AutomationBench pass‑rate в 1,5 раза превышает конкурентов; на OSWorld 2.0 она превосходит Fable 5 уже при трети стоимости. При том же расходе, что и у Opus 4.8, она показывает значительное улучшение: на organic‑chemistry задачи её точность на 10,2 п.п. выше, а на protein‑задачи — на 7,7 п.п.

Модель умеет проверять собственные ответы и итеративно дорабатывать решения; в тесте без доступа к визуальному вводу она самостоятельно создала pipeline для распознавания пикселей и построения 3D‑модели в FreeCAD, повторив успех многократно. При обнаружении бага в популярном package‑manager’е она нашла корень проблемы, тогда как конкуренты исправили лишь симптом. В API добавлены возможности менять набор инструментов в середине диалога и автоматические fallback‑ы, направляющие запросы, помеченные безопасностью, на альтернативную модель; при этом данные пользователей не хранятся.

by alvis • 24 июля 2026 г. в 16:57 • 1710 points

ОригиналHN

#anthropic#claude-opus-5#freecad

Комментарии (1168)

Opus 5 превосходит Fable 5 в image-to-code и автономном планировании, демонстрируя лучшую визуальную точность (например, в воспроизведении дизайна кнопок) и проактивность — например, самостоятельно реализовала движок слайдов вместо reveal.js. Она не требует 30-дневного хранения данных, что критично для строгих политик конфиденциальности. Стиль письма сохраняет клише Claude 4.8, в отличие от Fable 5. Однако выявлены критические проблемы: ложные срабатывания в code review (особенно в C/C++, 4 false positives, GPT-5.6-sol справился лучше), неучёт контекста вызовов функций, деградация инфраструктуры — постоянные сбои, потери сессий, HTTP-ошибки, необоснованные блокировки аккаунтов. Удалены полные цепочки рассуждений — осталась только однострочная сводка, снижая аналитическую ценность. Режим 'low' reasoning даёт оптимальное соотношение цена/качество. Fable 5 остаётся лучше в создании идеальных SVG (тест Pelican), а Opus 5 ошибается при редактировании код-планов, проверявшихся ранее GPT-6 Sol. Сафегарды Fable 5 были чрезмерно строги (блокировали медицинскую терминологию); Opus 5, возможно, смягчил это, но поиск уязвимостей в коде всё ещё ограничен. Сравнение с другими моделями: Opus 5 на 10% «умнее» Grok 4.5, но в 10 раз дороже; немного умнее GPT 5.6 Sol при стоимости в 2.75 раза выше — вызывает вопросы о рентабельности. Сложность выбора моделей (модальности, уровни thinking, цены) стимулирует рост рынка routing-сервисов. Частые изменения тарифов, кредитов и метрик намеренно запутывают клиентов, делая сравнение и контроль затрат невозможными. Бенчмарки (Frontier-Bench, AutomationBench) подвергаются сомнению из-за коммерческих интересов Anthropic и партнёров — требуются независимые оценки, хотя скачок на ARC-AGI-3 на 30% считается значимым.