Hacker News Digest

03 сентября 2026 г. в 18:32 • inference-docs.cerebras.ai • ⭐ 577 • 💬 191

OriginalHN

#cerebras#gpt-oss#public-endpoint#qwen#weight-only-quantization

Qwen 3.8 27B available on Cerebras at 1500 tokens/s

Cerebras публикует открытые модели в своих публичных эндпоинтах, доступных на бесплатном пробном и pay-as-you-go тарифах с ограничениями по скорости и цене. Сейчас доступны две модели: GPT OSS 120B с 120 млрд параметров, контекстом 65k/131k токенов (бесплатно/платно) и скоростью ~3000 токенов/с, а также Qwen 3.8 27B с 27 млрд параметров, контекстом 64k/128k токенов и скоростью ~1500 токенов/с. Все модели на публичных эндпоинтах являются оригинальными, непруненными версиями — Cerebras не изменяет архитектуру моделей без предупреждения и не предлагает пруненные варианты в shared API. Для хранения используется селективное weight-only квантование (16/8/4 бит), при этом критичные слои хранятся в полной точности с онлайн-деквантизацией, чтобы вычисления выполнялись в высокой точности. Активации, внимание и KV-кэш остаются полной точности и не квантуются. Пруненные модели, такие как те, что получены через REAP-технику, доступны только для исследований на Hugging Face в коллекции Cerebras REAP и не служат производственными эндпоинтами. Cerebras подчеркивает прозрачность: любые будущие сжатые версии будут выделены как отдельные эндпоинты с явным命名ованием, чтобы пользователи могли осознанно выбирать между оригинальными и модифицированными моделями. Это позволяет сохранить доверие и контроль над тем, какая версия модели используется в продакшене.