Qwen3.8-Flash-Next 🔥 Горячее 💬 Длинная дискуссия
Qwen3.8-Flash-Next — это мультимодальная MoE-модель с 125B параметрами и 51B N-gram-встраиваний, активирующая всего 6B параметров на токен. Она служит ранним превью архитектуры Qwen4 и улучшает эффективность за счёт четырёх ключевых нововведений: гибридного внимания GDN + QSA, гейтованного остатка (GR) с четырьмя ветвями, N-gram-встраиваний, выгружаемых в хост-память с асинхронной префетчкой, и оптимизатора Muon, настроенного под новую архитектуру. Благодаря этим изменениям модель достигает превосходных результатов в кодинге и офисных задачах при обучении, требующем лишь 1/9 ресурсов по сравнению с Qwen3.7-Plus.
Модель поддерживает контекст до 262 144 токенов нативно и масштабируется до 1 000 000 токенов с YaRN. Qwen Sparse Attention (QSA) использует лёгкий индексатор для выбора важного контекста на уровне микроблоков, резко снижая стоимость внимания на длинных последовательностях. Gated DeltaNet (GDN) эффективно сжимает историю, а гейтованный остаток улучшает межслойный поток информации и стабильность обучения. N-gram-встраи позволяют увеличить ёмкость модели с минимальными вычислительными издержками благодаря табличному поиску по локальному контексту. Все компоненты работают совместно для достижения максимальной стоимостной эффективности без потери качества.
Комментарии (220)
Тред дополняет статью практикой локального запуска: подтверждает жизнеспособность модели на 128GB-системах (Strix Halo, Mac, DGX Spark), уточняет реальные размеры и проблемы N-gram сайдкара, даёт конкретные цифры скорости и стоимости, и фиксирует нерешённые вопросы по длинному контексту и совместимости с llama.cpp/vLLM/LM Studio.
-
Совет: @xlayn слил llama.cpp с поддержкой дискового кэша N-gram: ~23.54 tok/s на IQ4_XS; @hedgehog на Ryzen 395 / Strix Halo получает ~22 tok/s, качество лучше 3.8 27B и достаточно хорошее, чтобы уйти с 3.6 35B, хотя 35B всё ещё быстрее.
-
Совет: @cmrdporcupine выложил отдельный движок инференса под DGX Spark: ~80 tok/s prefill, 12 tok/s decode, ~80 GiB в RAM, N-gram-таблицы подгружаются с SSD.
-
Совет: @pram отмечает: релиз Unsloth Desktop весит 73GB, то есть влезает в 128GB Mac и Strix Halo; @jedisct1 опубликовал MLX-кванты oQ4e-128k для Apple M5 128 GiB.
-
Спор: @potus_kushner vs @pbmonster о N-gram сайдкаре: @pbmonster считает, что горячие N-gram держатся в RAM, остальные тянутся с SSD, @potus_kushner возражает — Unsloth показывает 50GB при заявленных 4 битах, что ломает сценарий «64GB RAM с 2–3 битным квантом» и делает модель фактически недоступной для обычных пользователей.
-
Совет: @andy99 сомневается, что 176B суммарных параметров влезут в 4-битный квант под 100GB; @pbmonster уточняет — N-gram параметры могут жить на SSD с кэшем горячих в памяти.
-
Совет: @monster_truck делится опытом в QwenCloud за $18: склеил форки, сделал чистый merge, bisect регрессии и фикс через проектные тулы; 90M входных/400k выходных токенов за $0.45, потрачено менее 10% недельного лимита.
-
Несколько участников (@martinald, @tristor, @garo-pro) подтверждают: в mainline llama.cpp, vLLM и LM Studio модель пока не запускается; Unsloth уже отправил патчи в llama.cpp.
-
Спор: @simonw: на DGX Spark с UD-IQ1_S результаты хуже, чем у Qwen 3.8 27B; @hedgehog на IQ-квантах в llama.cpp и @freakynit, @whwhyb — напротив, качество выше 27B и лучше DeepSeek V4 Flash. Различие списывают на агрессивность кванта у Simon.
-
Совет: @armcat поднимает вопрос входной вербозности: GLM 5.2 на их бизнес-нагрузках накапливал много thinking-токенов, Qwen3.8-27B удваивал это; просит данные о token efficiency именно у Flash-Next.
-
Совет: @anon373839 ищет инфу о поведении на DGX Spark на длинных контекстах: при 273 GB/s пропускной способности результаты противоречивы и неполны.
-
Участники (@tosh, @lucabytheway, @Imustaskforhelp, @garo-pro) считают релиз значимым: новая архитектура (предвестник Qwen 4), обучение в 1/9 стоимости Qwen3.7-Plus при лучших результатах; N-gram-встраивания уже использовались в DeepSeek, Gemma и Longcat.
-
Совет: @amclennon и @respectattentio: модель дешевле DeepSeek Flash по API и подчёркивает разницу стратегий — китайские лаборатории выпускают веса с первого дня, американские держат модели под замком.
DeepSeek V4 Flash on a Single AMD MI300X 🔥 Горячее
Главная идея — первый рабочий запуск DeepSeek‑V4‑Flash‑0731 на одной видеокарте AMD MI300X без дополнительной квантовки или оффлоу. Модель полностью помещается в 156,7 GiB HBM3, а благодаря 192 GiB памяти и 5,3 TB/s пропускной способности достигается пропускная способность до ≈ 8 K токенов/сек при предзаполнении и 168,6 токенов/сек в медиане однопоточного декодирования. При 8‑х одновременных потоках суммарный вывод достигает 542 токенов/сек, а пиковый 64‑потоковый баст‑запрос укладывается в 830 токенов/сек без OOM и ошибок движка. Контекст поддерживается до 256 K токенов (архитектура теоретически позволяет 1 M).
Ключевые факты, которые стоит запомнить:
- 156,7 GiB весов — полностью в HBM, без offload‑квантовки;
- ≈ 8 K tok/s предзаполнение (6 988–7 019 tok/s в продакшн‑профиле);
- 542 tok/s суммарный вывод при 8‑х потоках, 830 tok/s при 64‑потоковом басте;
- Исправления касаются FP8‑формата MI300X, MoE‑маршрутизации, CPU‑KV синхронизации и специфичных ядер ROCm.
Эти детали позволяют использовать MI300X как дешевый (в 2–3 раза) альтернативный вариант к NVIDIA‑решениям для тяжёлых LLM‑задач.
Комментарии (87)
DeepSeek V4 Flash можно запускать на AMD MI300X, но с ограничением контекстного окна с 1M до 256k — по опыту @monster_truck, это не снижает качество. @Tepix считает MI300X неподходящей как OAM-модуль, но @WhitneyLand отмечает, что модель работает, хоть и с ограничениями. MI350P — альтернатива с 144GB памяти, но меньшей, чем у MI300X. @fergusfinn советует использовать MI300X с высоким HBM и делится опытом работы с 2xMI300X. Производительность MI300X всё ещё ниже, чем у H800 (15k токенов/сек).
Show HN: Run an 80B Qwen in 4.3 GB of RAM on a Mac, and a 35B on an iPhone
Swiftlet — это рантайм на Swift + Metal, позволяющий запускать гибридные модели Qwen3‑Next и Qwen3.5/3.6 MoE на обычных iOS‑устройствах. Вместо того, чтобы держать весь параметр в памяти, в RAM остаётся лишь небольшая плотная «ядровая» часть, а остальные эксперты потоково читаются из хранилища, что делает возможным работу 35‑B и даже 80‑B моделей на iPhone 17 (примерно 2,5 ГБ RAM, 1 токен/сек).
Ключевые приёмы: чтение экспертов через pread в ограниченный пул слотов, выгрузка по LFU + recency, фиксированный stride‑пакетный ввод‑вывод и мгновенная компиляция шейдеров. Архитектурно проект поддерживает альтернативные схемы внимания (Gated DeltaNet, gated GQA), int4/int8‑квантование в Metal и полную систему установки, кэширования и обработки разговоров. В результате на Mac‑е 35‑B модель потребляет лишь 2,6 ГБ RAM и генерирует 7‑11 токен/сек, а 80‑B — 4,3 ГБ и 4,5‑5 токен/сек.
Комментарии (115)
Тред обсуждает запуск крупных моделей на устройствах с ограниченными ресурсами — iPhone и Mac. По опыту @leonickson, на Mac с 32 ГБ RAM увеличение кэша до 8 ГБ не ускоряет работу — узкое место — GPU, а не RAM. @adrianco советует увеличивать RAM-кэш на устройствах с 24–32 ГБ RAM — это может значительно ускорить работу. @dghlsakjg видит в этом прогресс и предполагает будущее запуска моделей на дешёвом оборудовании, например, SSD за $200. @jarek83 и @arjie спорят о реалистичности запуска 1T-параметровых моделей на таком оборудовании, указывая на ограничения и стоимость. @throwawayffffas и @leonickson обсуждают износ SSD при использовании для моделей; @throwawayffffas отмечает, что у него SSD работает долго без проблем.