Hacker News Digest

19 августа 2026 г. в 00:28 • cerebras.ai • ⭐ 396 • 💬 237

OriginalHN

#cerebras#cs-4#energy-efficiency#gpu#high-performance-computing#latency#model-inference#rack-scale-system#token#wafer-scale-engine

Cerebras CS-4

Cerebras CS-4 — новая rack‑scale система, в которой три ускорителя Wafer‑Scale Engine 3 Turbo (WSE‑3T) работают совместно, обеспечивая до 30‑кратного ускорения вывода по сравнению с GPU‑решениями. Каждый WSE‑3T в два раза быстрее предыдущего поколения, а благодаря новым системам питания, охлаждения и ввода‑вывода производительность на один чип возрастает в 10 раз при том же энергопотреблении.

Ключевые цифры: до 1 000 токенов / сек на моделях > 10 трлн параметров, 30‑кратное ускорение вывода, 10‑кратное увеличение пропускной способности на ватт, а latency между воркерами сокращена до 2 мкс, что делает интерактивный декодинг возможным даже при десятках триллионов параметров. Архитектура Nexus разделяет стационарную инфраструктуру (питание, охлаждение, сеть) от модульных вычислительных «бэкендов», позволяя развернуть систему за часы вместо дней.

Запомните: CS‑4 — первый в мире ускоритель, способный обслуживать гигантские модели в реальном времени, при этом потребляя в 2‑3 раза меньше энергии на токен, чем традиционные GPU‑кластеры.