Hacker News Digest

16 августа 2026 г. в 23:45 • simonwillison.net • ⭐ 603 • 💬 292

OriginalHN

#alibaba#apache-2.0#dgx-spark#gguf#llama.cpp#lmstudio#mtp#nvidia#qwen#svg

Qwen 3.8 27B is excellent, but it defaults to overthinking things

Qwen 3.8 27B — Alibaba‑разработанная 27‑параметровая LLM с поддержкой визуального ввода, работает под лицензией Apache 2 и умеет генерировать сложные SVG‑рисунки, но по умолчанию включает «xhigh»‑уровень рассуждений, который превращает простые запросы в часы‑долгие раздумья. На ноутбуке с 128 ГБ RAM и на сервере NVIDIA DGX Spark я использовал 17 ГБ‑квантованную версию в LM Studio, увеличив контекст до 262 144 токенов; при включённом рассуждении модель потратила 21 минуту на создание SVG‑картинки пеликана, а без него — лишь 2 минуту, получив менее детализированный результат.

Запомните:

  • 27 Б‑модель помещается в 17 ГБ файла и способна к полноценному генеративному рисованию и коду.
  • Параметр reasoning_effort (xhigh/medium/low) сильно влияет на скорость; отключив «xhigh», время генерации падает почти в 10 раз.
  • При работе через llama.cpp с MTP‑режимом (draft‑mtp) ускорение достигает ~72 % по сравнению с базовым GGUF‑режимом.

Эти факты показывают, что даже крупные открытые модели теперь доступны для локального использования без дорогостоящего дата‑центра, однако их производительность ограничена пропускной способностью памяти.