Small Models Have Arrived 🔥 Горячее 💬 Длинная дискуссия
Новые маленькие модели, такие как gpt-5.6-luna, удивительно быстрые и эффективные — до 100 токенов в секунду — при стоимости в десятки центов за сложные задачи, включая анализ тысяч писем. Это кардинально меняет экономику AI: раньше для персонализированного новостного сайта с использованием дорогих моделей требовалось $1 за запрос, что делало потребительский продукт невыгодным; теперь стоимость падает до $0.10, открывая путь к масштабируемым сервисам.
В бизнесе большинство задач — не прорывные, а рутинные: переписка, координация, уведомления. Даже опытные основатели, вроде Петера из Segment, тратят 95% времени на такие «токен-спьютерные» дела. Маленькие, дешёвые и быстрые модели идеально подходят именно для них — заменяя людей, выполняющих повторяющуюся работу. Хотя фронтальные модели останутся нужны для научных прорывов, спрос на «хорошие, но недорогие» модели только растёт. Остаётся решить технические вопросы — безопасность, роли, интеграции — но направление ясно: будущее за эффективностью, а не за мощностью.
Комментарии (308)
Тред подтверждает тезис о 'good enough' малых моделях, но с оговорками: скрытая стоимость reasoning-токенов, реальные цифры из прода, возражения по качеству на коде и спор о ценообразовании проприетарных vs open-source. Спрос на дешёвые/быстрые модели всегда был — блокировал supply, а не спрос. Локальный запуск малых моделей побеждает cloud по latency, приватности и DX и станет следующей волной. Inference становится commodity-вычислением, дифференциация моделей сгладится; продукты будут выигрывать пониманием задач пользователя, а не выбором модели. Специализированные маленькие модели давно используются в проде из-за цены, скорости и меньших галлюцинаций. Спор о качестве: часть участников считает Luna достаточной для 90% задач и vibe-кодинга за центы; другие возражают — Sol/Opus ловят баги, которые Luna пропускает; описан случай галлюцинации с фиктивным коммитом, когда дешёвая модель вызывала раздражение. Спор о цене: одни считают, что closed-source победит по цене за счёт scale и оптимизации стека, оставив open-source нишу приватности/кастомизации; другие продвигают self-hosted на edge как более дешёвую и лёгкую альтернативу. Спор о скорости: TPS раздут из-за thinking-токенов, нужен показатель с учётом reasoning-эффективности. Советы из опыта: $10 кредита OpenAI (~126 запросов) сожгли $0.61 — API inference дёшев даже для прототипов. Reasoning-модели могут тратить ~2800 thinking-токенов на вызов — это в 3 раза дороже non-reasoning, за ними нужно следить. Luna достаточна для ~90% правок кода; Sol/Fable нужны для сложных задач при готовности строить guardrails. Опыт с 7B локальной моделью и guided generation с test-driven циклом ещё до эпохи thinking-моделей давал аналогичное поведение. Открытый вопрос — как перестроить workflow под малые модели при текущем использовании Opus со spec-driven подходом. Для embedded-демо ищут модели ~100 MiB (SmolLM 2 в Q4 — пограничный вариант) — ниша миниатюрных моделей не заполнена. Тренд: self-hosted модели, дообученные на собственных reasoning traces (QLoRA), inference как 'библиотека на бэкенде'. Практический кейс: Luna сделал возможным vibe-кодинг маленьких приложений за ~$5 и эксплуатацию за центы в день.
Cerebras CS-4 🔥 Горячее 💬 Длинная дискуссия
Cerebras CS-4 — новая rack‑scale система, в которой три ускорителя Wafer‑Scale Engine 3 Turbo (WSE‑3T) работают совместно, обеспечивая до 30‑кратного ускорения вывода по сравнению с GPU‑решениями. Каждый WSE‑3T в два раза быстрее предыдущего поколения, а благодаря новым системам питания, охлаждения и ввода‑вывода производительность на один чип возрастает в 10 раз при том же энергопотреблении.
Ключевые цифры: до 1 000 токенов / сек на моделях > 10 трлн параметров, 30‑кратное ускорение вывода, 10‑кратное увеличение пропускной способности на ватт, а latency между воркерами сокращена до 2 мкс, что делает интерактивный декодинг возможным даже при десятках триллионов параметров. Архитектура Nexus разделяет стационарную инфраструктуру (питание, охлаждение, сеть) от модульных вычислительных «бэкендов», позволяя развернуть систему за часы вместо дней.
Запомните: CS‑4 — первый в мире ускоритель, способный обслуживать гигантские модели в реальном времени, при этом потребляя в 2‑3 раза меньше энергии на токен, чем традиционные GPU‑кластеры.
Комментарии (237)
Cerebras CS-4 — нишевое решение для инференса с высокой стоимостью и энергопотреблением (162 кВт), не предназначенное для массового рынка. Его 2x ускорение по сравнению с Groqvidia недостаточно для массового перехода, а заявления о 30x превосходстве над GPU неполны — не указаны модели, количество, цена и энергопотребление GPU. Десктопная версия невозможна: загрузка модели в SRAM стоит ~$100K. Система рискованна для критических нагрузок — при потере питания WSE-3T становится бесполезной. Cerebras работает с корпоративными клиентами, используя open-weight модели, что отражает бизнес-модель, а не технологическое лидерство. Отсутствие SLA на отказоустойчивость усугубляет риски. Эффективность KV-кэширования критична для глубоких контекстов — иначе задержки становятся неприемлемыми. Инференс на Cerebras не означает превосходства над GPT-5.6: параметры модели и производительность инференса — разные вещи. OpenAI и Anthropic должны приобрести Cerebras, чтобы создать аппаратный барьер, как Google и Apple; AMD могла бы выиграть от покупки, чтобы оспорить монополию Nvidia. Аппаратная оптимизация для LLM только начинается — в ближайшие 5–10 лет ожидается экспоненциальный рост эффективности железа и ПО, снижающий зависимость от GPU. Критика маркетингового стиля («path to deploy») не делает продукт хуже — это человеческая работа, а не LLM.
Accelerating GPT-5.6 Sol Ultrafast 🔥 Горячее 💬 Длинная дискуссия
GPT-5.6 Sol на режиме Ultrafast от OpenAI в сочетании с Cerebras выдаёт до 750 токенов в секунду без потери качества, что резко ускоряет работу с критически важными задачами. Тесты на Humanity's Last Exam показали, что модель проанализировала 2 500 сложных вопросов за 11 ч 11 мин, тогда как Claude 5 потратил более трёх суток. На GDP‑Val Ultrafast ускорил выполнение экономически значимых задач в 5,6 раз, сохранив точность.
Техническая основа — уникальная архитектура Wafer‑Scale Engine Cerebras, где 44 ГБ SRAM находятся непосредственно на чипе, исключая дорогостоящее перемещение весов между памятью и процессором. Это позволяет токены свободно «течь» через слои модели, а при росте размеров моделей скорость сохраняется. Теперь пользователи могут использовать агенты в реальном времени: от мгновенного анализа сбоев в сервисах до быстрой реакции на кибератаки, что меняет подход к работе с высокими ставками.
Комментарии (258)
Тред дополняет статью информацией о потенциальных последствиях, применении и ограничениях технологии Ultrafast, а также сравнивает её с другими моделями и обсуждает затраты. Пользователи согласны, что Ultrafast может революционизировать работу с критически важными задачами, где скорость обработки влияет на качество решений. Особенно полезна для кодирования и анализа данных. Однако предупреждают: технология может быть недоступна всем, сопряжена с высокими затратами и несет риск потери качества при увеличении скорости. Рекомендуется использовать специализированное оборудование для максимальной эффективности.