Тред дополняет статью практикой локального запуска: подтверждает жизнеспособность модели на 128GB-системах (Strix Halo, Mac, DGX Spark), уточняет реальные размеры и проблемы N-gram сайдкара, даёт конкретные цифры скорости и стоимости, и фиксирует нерешённые вопросы по длинному контексту и совместимости с llama.cpp/vLLM/LM Studio.
-
Совет: @xlayn слил llama.cpp с поддержкой дискового кэша N-gram: ~23.54 tok/s на IQ4_XS; @hedgehog на Ryzen 395 / Strix Halo получает ~22 tok/s, качество лучше 3.8 27B и достаточно хорошее, чтобы уйти с 3.6 35B, хотя 35B всё ещё быстрее.
-
Совет: @cmrdporcupine выложил отдельный движок инференса под DGX Spark: ~80 tok/s prefill, 12 tok/s decode, ~80 GiB в RAM, N-gram-таблицы подгружаются с SSD.
-
Совет: @pram отмечает: релиз Unsloth Desktop весит 73GB, то есть влезает в 128GB Mac и Strix Halo; @jedisct1 опубликовал MLX-кванты oQ4e-128k для Apple M5 128 GiB.
-
Спор: @potus_kushner vs @pbmonster о N-gram сайдкаре: @pbmonster считает, что горячие N-gram держатся в RAM, остальные тянутся с SSD, @potus_kushner возражает — Unsloth показывает 50GB при заявленных 4 битах, что ломает сценарий «64GB RAM с 2–3 битным квантом» и делает модель фактически недоступной для обычных пользователей.
-
Совет: @andy99 сомневается, что 176B суммарных параметров влезут в 4-битный квант под 100GB; @pbmonster уточняет — N-gram параметры могут жить на SSD с кэшем горячих в памяти.
-
Совет: @monster_truck делится опытом в QwenCloud за $18: склеил форки, сделал чистый merge, bisect регрессии и фикс через проектные тулы; 90M входных/400k выходных токенов за $0.45, потрачено менее 10% недельного лимита.
-
Несколько участников (@martinald, @tristor, @garo-pro) подтверждают: в mainline llama.cpp, vLLM и LM Studio модель пока не запускается; Unsloth уже отправил патчи в llama.cpp.
-
Спор: @simonw: на DGX Spark с UD-IQ1_S результаты хуже, чем у Qwen 3.8 27B; @hedgehog на IQ-квантах в llama.cpp и @freakynit, @whwhyb — напротив, качество выше 27B и лучше DeepSeek V4 Flash. Различие списывают на агрессивность кванта у Simon.
-
Совет: @armcat поднимает вопрос входной вербозности: GLM 5.2 на их бизнес-нагрузках накапливал много thinking-токенов, Qwen3.8-27B удваивал это; просит данные о token efficiency именно у Flash-Next.
-
Совет: @anon373839 ищет инфу о поведении на DGX Spark на длинных контекстах: при 273 GB/s пропускной способности результаты противоречивы и неполны.
-
Участники (@tosh, @lucabytheway, @Imustaskforhelp, @garo-pro) считают релиз значимым: новая архитектура (предвестник Qwen 4), обучение в 1/9 стоимости Qwen3.7-Plus при лучших результатах; N-gram-встраивания уже использовались в DeepSeek, Gemma и Longcat.
-
Совет: @amclennon и @respectattentio: модель дешевле DeepSeek Flash по API и подчёркивает разницу стратегий — китайские лаборатории выпускают веса с первого дня, американские держат модели под замком.