Accelerating GPT-5.6 Sol Ultrafast 🔥 Горячее 💬 Длинная дискуссия
GPT-5.6 Sol на режиме Ultrafast от OpenAI в сочетании с Cerebras выдаёт до 750 токенов в секунду без потери качества, что резко ускоряет работу с критически важными задачами. Тесты на Humanity's Last Exam показали, что модель проанализировала 2 500 сложных вопросов за 11 ч 11 мин, тогда как Claude 5 потратил более трёх суток. На GDP‑Val Ultrafast ускорил выполнение экономически значимых задач в 5,6 раз, сохранив точность.
Техническая основа — уникальная архитектура Wafer‑Scale Engine Cerebras, где 44 ГБ SRAM находятся непосредственно на чипе, исключая дорогостоящее перемещение весов между памятью и процессором. Это позволяет токены свободно «течь» через слои модели, а при росте размеров моделей скорость сохраняется. Теперь пользователи могут использовать агенты в реальном времени: от мгновенного анализа сбоев в сервисах до быстрой реакции на кибератаки, что меняет подход к работе с высокими ставками.
Комментарии (258)
Тред дополняет статью информацией о потенциальных последствиях, применении и ограничениях технологии Ultrafast, а также сравнивает её с другими моделями и обсуждает затраты. Пользователи согласны, что Ultrafast может революционизировать работу с критически важными задачами, где скорость обработки влияет на качество решений. Особенно полезна для кодирования и анализа данных. Однако предупреждают: технология может быть недоступна всем, сопряжена с высокими затратами и несет риск потери качества при увеличении скорости. Рекомендуется использовать специализированное оборудование для максимальной эффективности.
The new rules of context engineering for Claude 5 generation models 🔥 Горячее 💬 Длинная дискуссия
Современные модели Claude 5 требуют иного подхода к инженерии контекста: вместо жёстких правил — доверие к способности модели судить. Раньше системные промпты насыщали запретами («никаких многострочных комментариев»), но теперь достаточно указать: «пиши код так, как пишут вокруг». Модели стали достаточно умны, чтобы адаптироваться к стилю, не требуя микроруководств.
Теперь ключ — в дизайне инструментов, а не примерах их использования. Описания должны быть выразительными: например, перечисление статусов задачи (pending/in_progress/completed) само подсказывает логику. Контекст загружается по мере необходимости — через «отложенную загрузку» и прогрессивную раскрытие. CLAUDE.md и навыки должны быть лёгкими, фокусироваться на неочевидных особенностях кода, а не повторять очевидное. Ссылки на файлы (например, HTML-макеты) эффективнее текстовых описаний. Инструмент claude doctor помогает автоматически упрощать промпты, убирая избыточность.
Комментарии (275)
Тред дополняет статью опытом пользователей, подчеркивая необходимость тонкого управления контекстом для Claude 5 и выражая сомнения в эффективности и безопасности предложенного подхода. @firasd советует использовать простой, прямой контекст, не перегружая инструкциями — полагаться на способность модели адаптироваться к стилю. @nullbio отмечает, что Claude часто игнорирует инструкции, что делает его использование неприятным; он предпочитает GPT за точное следование указаниям. @guybedo предлагает относиться к моделям как к младшим членам команды: давать четкое, непротиворечивое руководство, фокусируясь на вкусе и предпочтениях, а не деталях. @sothatsit и @boorang указывают на важность управления контекстом и отключения автоматической памяти в Claude Code для предотвращения случайной потери контекста и улучшения производительности. @rTX5CMRXIfFG считает, что подход из статьи повышает затраты на токены и несет риски ответственности, если сгенерированный код вызовет проблемы.
GPT-5.5 hallucinates 3x more than MIT-licensed GLM-5.2 🔥 Горячее 💬 Длинная дискуссия
Большие модели больше не гарантируют лучшего понимания — их «ум» часто Plateau‑ит, а точность падает из‑за чрезмерного доверия к собственным ответам. Недавние сравнения показывают, что открытая GLM‑5.2 (≈753 млрд параметров) почти догоняет закрытые GPT‑5.5 и Claude 5, но её галлюцинации составляют лишь 28 %, тогда как у GPT‑5.5 — 86 %. При этом DeepSeek V4 Pro (1,6 Трл параметров) выдаёт 94 % ошибок на бенчмарке «Omniscience», а Opus 4.8 — 36 %. Технические тесты подтверждают: даже при большом объёме вычислительных ресурсов модель может уверенно предложить неверное решение, не признавая своей неуверенности.
Эта ситуация формирует трилемму современных ИИ:raw‑capability, калибровка неопределённости и вычислительная эффективность. Увеличивать размер и «рассудочный бюджет» бессмысленно, если модель начинает продавать вымысел за правду. Поэтому будущее — в выборе моделей, способных честно сообщать «не знаю», а не в гонке за всё более массивными, но менее надёжными системами.
Комментарии (293)
- Оценка галлюцинаций усложняется тем, что она зависит от того, когда модель не знает ответа и от распределения задач в тесте.
- Увеличение размеров моделей часто не повышает точность и может ухудшать способность «отказываться» от неправильных ответов.
- Некоторые крупные модели (DeepSeek V4 Pro, GLM‑5.2) показывают разный уровень галлюцинаций, при этом небольшие модели иногда справляются лучше.
- Необходимо развивать более точную классификацию ошибок ИИ, а не ограничиваться общим термином «галлюцинация».