Hacker News Digest

26 августа 2026 г. в 12:52 • qwen.ai • ⭐ 677 • 💬 220

OriginalHN

#gdn#moe#muon-optimizer#n-gram-embeddings#qsa#qwen.ai#qwen3.7-plus#qwen3.8-flash-next#qwen4#yarn

Qwen3.8-Flash-Next

Qwen3.8-Flash-Next — это мультимодальная MoE-модель с 125B параметрами и 51B N-gram-встраиваний, активирующая всего 6B параметров на токен. Она служит ранним превью архитектуры Qwen4 и улучшает эффективность за счёт четырёх ключевых нововведений: гибридного внимания GDN + QSA, гейтованного остатка (GR) с четырьмя ветвями, N-gram-встраиваний, выгружаемых в хост-память с асинхронной префетчкой, и оптимизатора Muon, настроенного под новую архитектуру. Благодаря этим изменениям модель достигает превосходных результатов в кодинге и офисных задачах при обучении, требующем лишь 1/9 ресурсов по сравнению с Qwen3.7-Plus.

Модель поддерживает контекст до 262 144 токенов нативно и масштабируется до 1 000 000 токенов с YaRN. Qwen Sparse Attention (QSA) использует лёгкий индексатор для выбора важного контекста на уровне микроблоков, резко снижая стоимость внимания на длинных последовательностях. Gated DeltaNet (GDN) эффективно сжимает историю, а гейтованный остаток улучшает межслойный поток информации и стабильность обучения. N-gram-встраи позволяют увеличить ёмкость модели с минимальными вычислительными издержками благодаря табличному поиску по локальному контексту. Все компоненты работают совместно для достижения максимальной стоимостной эффективности без потери качества.