Qwen 3.8 27B available on Cerebras at 1500 tokens/s 🔥 Горячее 💬 Длинная дискуссия
Cerebras публикует открытые модели в своих публичных эндпоинтах, доступных на бесплатном пробном и pay-as-you-go тарифах с ограничениями по скорости и цене. Сейчас доступны две модели: GPT OSS 120B с 120 млрд параметров, контекстом 65k/131k токенов (бесплатно/платно) и скоростью ~3000 токенов/с, а также Qwen 3.8 27B с 27 млрд параметров, контекстом 64k/128k токенов и скоростью ~1500 токенов/с. Все модели на публичных эндпоинтах являются оригинальными, непруненными версиями — Cerebras не изменяет архитектуру моделей без предупреждения и не предлагает пруненные варианты в shared API. Для хранения используется селективное weight-only квантование (16/8/4 бит), при этом критичные слои хранятся в полной точности с онлайн-деквантизацией, чтобы вычисления выполнялись в высокой точности. Активации, внимание и KV-кэш остаются полной точности и не квантуются. Пруненные модели, такие как те, что получены через REAP-технику, доступны только для исследований на Hugging Face в коллекции Cerebras REAP и не служат производственными эндпоинтами. Cerebras подчеркивает прозрачность: любые будущие сжатые версии будут выделены как отдельные эндпоинты с явным命名ованием, чтобы пользователи могли осознанно выбирать между оригинальными и модифицированными моделями. Это позволяет сохранить доверие и контроль над тем, какая версия модели используется в продакшене.
Комментарии (191)
Cerebras не подходит для агентных задач: несмотря на высокую скорость генерации (до 1500 токенов/с), отсутствует кэширование промптов, что делает его дороже OpenRouter при повторных запросах, даже при более низкой цене за выходные токены ($1.5/M против $2.55/M). Лимиты в минуту (например, 450k TPM для Qwen 3.8 27B исчерпываются за 90 секунд) и учёт кэшированных токенов в лимите приводят к неожиданным расходам. Ограничение контекста в 128k токенов делает модель непригодной для анализа больших кодовых баз (например, Guice library требует 250k). Локальная инференция на RTX 5090/6000 (200–600 токенов/с) экономичнее и стабильнее для агентов, но некоторые пользователи сталкиваются с зацикливанием и потерей контекста у Qwen 3.8 27B. Cerebras удалил Gemma-4 31B с платного тарифа, несмотря на его лучшее понимание намерений, что указывает на фокус только на генерацию кода. Частые ошибки инструментальных вызовов увеличивают затраты, особенно по сравнению с DeepSeek-V4-Flash. Доступ к платформе затруднён: проблемы с регистрацией (redirect loop, блокировка email), отсутствие поддержки вне Discord, ошибки вида «model not found» вместо реальных причин (например, billing restrictions), и невозможность добавить оплату — аккаунты попадают в «limbo». Cerebras не предоставляет доступ к своим моделям через OpenRouter, несмотря на наличие других моделей там, что снижает прозрачность. Для индивидуальных разработчиков без командной поддержки платформа непригодна из-за ограничений на TPM и блокировки доступа к биллингу. В итоге, высокая скорость не компенсирует нехватку кэширования, лимиты и высокую стоимость — Cerebras эффективен только для разовых запросов.
Cerebras CS-4 🔥 Горячее 💬 Длинная дискуссия
Cerebras CS-4 — новая rack‑scale система, в которой три ускорителя Wafer‑Scale Engine 3 Turbo (WSE‑3T) работают совместно, обеспечивая до 30‑кратного ускорения вывода по сравнению с GPU‑решениями. Каждый WSE‑3T в два раза быстрее предыдущего поколения, а благодаря новым системам питания, охлаждения и ввода‑вывода производительность на один чип возрастает в 10 раз при том же энергопотреблении.
Ключевые цифры: до 1 000 токенов / сек на моделях > 10 трлн параметров, 30‑кратное ускорение вывода, 10‑кратное увеличение пропускной способности на ватт, а latency между воркерами сокращена до 2 мкс, что делает интерактивный декодинг возможным даже при десятках триллионов параметров. Архитектура Nexus разделяет стационарную инфраструктуру (питание, охлаждение, сеть) от модульных вычислительных «бэкендов», позволяя развернуть систему за часы вместо дней.
Запомните: CS‑4 — первый в мире ускоритель, способный обслуживать гигантские модели в реальном времени, при этом потребляя в 2‑3 раза меньше энергии на токен, чем традиционные GPU‑кластеры.
Комментарии (237)
Cerebras CS-4 — нишевое решение для инференса с высокой стоимостью и энергопотреблением (162 кВт), не предназначенное для массового рынка. Его 2x ускорение по сравнению с Groqvidia недостаточно для массового перехода, а заявления о 30x превосходстве над GPU неполны — не указаны модели, количество, цена и энергопотребление GPU. Десктопная версия невозможна: загрузка модели в SRAM стоит ~$100K. Система рискованна для критических нагрузок — при потере питания WSE-3T становится бесполезной. Cerebras работает с корпоративными клиентами, используя open-weight модели, что отражает бизнес-модель, а не технологическое лидерство. Отсутствие SLA на отказоустойчивость усугубляет риски. Эффективность KV-кэширования критична для глубоких контекстов — иначе задержки становятся неприемлемыми. Инференс на Cerebras не означает превосходства над GPT-5.6: параметры модели и производительность инференса — разные вещи. OpenAI и Anthropic должны приобрести Cerebras, чтобы создать аппаратный барьер, как Google и Apple; AMD могла бы выиграть от покупки, чтобы оспорить монополию Nvidia. Аппаратная оптимизация для LLM только начинается — в ближайшие 5–10 лет ожидается экспоненциальный рост эффективности железа и ПО, снижающий зависимость от GPU. Критика маркетингового стиля («path to deploy») не делает продукт хуже — это человеческая работа, а не LLM.
Accelerating GPT-5.6 Sol Ultrafast 🔥 Горячее 💬 Длинная дискуссия
GPT-5.6 Sol на режиме Ultrafast от OpenAI в сочетании с Cerebras выдаёт до 750 токенов в секунду без потери качества, что резко ускоряет работу с критически важными задачами. Тесты на Humanity's Last Exam показали, что модель проанализировала 2 500 сложных вопросов за 11 ч 11 мин, тогда как Claude 5 потратил более трёх суток. На GDP‑Val Ultrafast ускорил выполнение экономически значимых задач в 5,6 раз, сохранив точность.
Техническая основа — уникальная архитектура Wafer‑Scale Engine Cerebras, где 44 ГБ SRAM находятся непосредственно на чипе, исключая дорогостоящее перемещение весов между памятью и процессором. Это позволяет токены свободно «течь» через слои модели, а при росте размеров моделей скорость сохраняется. Теперь пользователи могут использовать агенты в реальном времени: от мгновенного анализа сбоев в сервисах до быстрой реакции на кибератаки, что меняет подход к работе с высокими ставками.
Комментарии (258)
Тред дополняет статью информацией о потенциальных последствиях, применении и ограничениях технологии Ultrafast, а также сравнивает её с другими моделями и обсуждает затраты. Пользователи согласны, что Ultrafast может революционизировать работу с критически важными задачами, где скорость обработки влияет на качество решений. Особенно полезна для кодирования и анализа данных. Однако предупреждают: технология может быть недоступна всем, сопряжена с высокими затратами и несет риск потери качества при увеличении скорости. Рекомендуется использовать специализированное оборудование для максимальной эффективности.
Cerebras Code now supports GLM 4.6 at 1000 tokens/sec
Cerebras привлек $1.1 млрд в раунде G по оценке $8.1 млрд, представив платформу для быстрой генерации кода на базе модели GLM-4.6. Эта модель обрабатывает более 1,000 токенов в секунду, занимая первое место в рейтинге вызова инструментов Berkeley Function Calling и демонстрируя производительность на уровне Sonnet 4.5 в веб-разработке. Платформа позволяет использовать GLM-4.6 с любым AI-дружелюбным редактором кода через API.
Компания предлагает три тарифных плана: бесплатный с ограниченным доступом, Pro за $50 в месяц (24 млн токенов в день) и Max за $200 (120 млн токенов). Эти варианты подходят как для небольших проектов, так и для полноценной разработки с интеграцией в IDE. Cerebras позиционирует свой сервис как решение для поддержания состояния потока программиста без ожидания генерации кода.
Комментарии (108)
- Cerebras Code с GLM 4.6 демонстрирует высокую скорость генерации (до 1000 ток/с), что значительно ускоряет итерации, особенно для UI-разработки и рутинных задач.
- Пользователи разделились: одни видят в скорости революцию для продуктивности ("секретное оружие"), другие скептичны, считая модель уступающей конкурентам (Claude, GPT) и сомневаясь в отсутствии квантования.
- Практическая ценность зависит от задач: скорость критична для быстрой обратной связи в веб-разработке, но менее полезна для глубокого кодирования или нишевых областей (embedded), где важнее точность.
- Поднимаются вопросы о реальной производительности модели, обоснованности цены ($50/мес) и устойчивости бизнес-модели, особенно при высоких затратах на токены.
- Аппаратная реализация (гигантский чип Cerebras) объясняет скорость, но вызывает споры о влиянии на качество вывода и отсутствие независимой верификации.