Qwen 3.8 27B is excellent, but it defaults to overthinking things 🔥 Горячее 💬 Длинная дискуссия
Qwen 3.8 27B — Alibaba‑разработанная 27‑параметровая LLM с поддержкой визуального ввода, работает под лицензией Apache 2 и умеет генерировать сложные SVG‑рисунки, но по умолчанию включает «xhigh»‑уровень рассуждений, который превращает простые запросы в часы‑долгие раздумья. На ноутбуке с 128 ГБ RAM и на сервере NVIDIA DGX Spark я использовал 17 ГБ‑квантованную версию в LM Studio, увеличив контекст до 262 144 токенов; при включённом рассуждении модель потратила 21 минуту на создание SVG‑картинки пеликана, а без него — лишь 2 минуту, получив менее детализированный результат.
Запомните:
- 27 Б‑модель помещается в 17 ГБ файла и способна к полноценному генеративному рисованию и коду.
- Параметр
reasoning_effort(xhigh/medium/low) сильно влияет на скорость; отключив «xhigh», время генерации падает почти в 10 раз. - При работе через
llama.cppс MTP‑режимом (draft‑mtp) ускорение достигает ~72 % по сравнению с базовым GGUF‑режимом.
Эти факты показывают, что даже крупные открытые модели теперь доступны для локального использования без дорогостоящего дата‑центра, однако их производительность ограничена пропускной способностью памяти.
Комментарии (292)
Избыточное рассуждение — системная проблема современных LLM, не уникальная для Qwen 3.8: аналогичное поведение у Opus 5, Claude и других моделей. Оно вызвано RLHF и дистилляцией, где перерассуждение выгодно для бенчмарков, но вредит интерактивному использованию: замедляет ответ в 7–9 раз, увеличивает токен-расход и снижает эффективность. Qwen 3.8 27B работает на потребительском железе (M4/M5 Max, 48–128 ГБ RAM), превосходит по качеству 3.6 и сопоставима с Opus 4.6 и Codex 5.3, но из-за медленной работы и неэффективности по токенам непрактична без настройки. Для локального использования рекомендуется квантованные версии Q4, а не 16-битные веса. Уровень рассуждений можно контролировать: через шаблоны GGUF (например, Froggeric), параметры llama.cpp (--thinking-budget, --thinking-message) или принудительные хаки (например, fork @shifto), отключая 'xhigh' и используя 'none' или 'low'. Это снижает задержку, но может слегка ухудшить качество. Для разработчиков — динамическое управление уровнем рассуждений по запросу. Скорость на CPU — до 8 минут на задачу, на GPU — до 11 часов на сложные; при частом использовании облачные API (например, Luna) экономически выгоднее. Модель способна находить баги в фреймворках (например, Next.js), но только после десятков часов рассуждений — непригодна как быстрый отладчик. MTP-слой позволяет предсказывать 6–8 токенов с высокой точностью, что частично компенсирует избыточность в генерации кода и SVG. Избыточное рассуждение делает модели неэффективными для продакшена, где важны скорость и лаконичность, а не идеальный бенчмарк.
Muse Glimmer: 30B-parameter model optimized for always-on local agent workflows 🔥 Горячее 💬 Длинная дискуссия
Muse Glimmer — 30‑модель с открытыми весами, предназначенная для работы агентов непосредственно на вашем устройстве. Она умеет планировать расписание, писать сообщения, организовывать файлы и учиться вашему стилю работы, используя длительные контексты, точный вызов инструментов и многомодальное понимание. Благодаря эффективному дистилляционному рецепту и оптимизациям (квантование, DFlash‑спекулятивное декодирование) модель укладывается в память обычного ноутбука или ПК с одной видеокартой и генерирует ответы в реальном времени.
Ключевые возможности: — полноценное выполнение задач (DeepSearch QA, MCP‑Atlas, 𝛕‑Bench, SWE‑Bench); — надёжный вызов функций в длительных цепочках; — цепочки рассуждений длиной в несколько шагов; — восстановление после ошибок инструментов. На MacBook M4‑Max, M5‑Max и RTX 5090 скорость декодирования ускоряется в 1,5–3,1 раза благодаря DFlash. Веса модели уже доступны на Hugging Face, а в ближайшее время появятся интеграции с llama.cpp, MLX, ExecuTorch и партнёрами (Ollama, LM Studio и др.), что позволит быстро запустить собственного локального агента.
Комментарии (526)
Тред дополняет статью практическим опытом использования Muse Glimmer, сравнениями с другими моделями (например, Qwen3.6 27B), техническими деталями и потенциальными применениями. Пользователи отмечают хорошую работу модели, но требуют 32–64 ГБ ОЗУ. Рекомендуют оптимизации — квантование и DFlash-спекуляция — для улучшения производительности на слабых устройствах. Модель применима для планирования, написания сообщений, организации файлов и адаптации к стилю пользователя. Указываются ограничения: высокие требования к памяти и возможные проблемы с производительностью на устройствах с ограниченными ресурсами.
Inkling: Our Open-Weights Model 🔥 Горячее 💬 Длинная дискуссия
Inkling — это открытая модель с полными весами, разработанная Thinking Machines, которая сочетает в себе 975 млрд параметров (41 млрд активных) и поддерживает контекст до 1 млн токенов. Обучена на 45 трлн токенов текста, изображений, аудио и видео, она является мультимодальной и оптимизирована для эффективного мышления: модель сознательно балансирует между качеством и стоимостью вычислений. В отличие от лидеров по точности, Inkling позиционируется как универсальная основа для кастомизации — сильная в широком спектре задач: кодировании, агентных сценариях, понимании изображений и аудио, а также соблюдении достоверности и безопасности.
Для удобства адаптации модель доступна через платформу Tinker с интерфейсом Inkling Playground для экспериментов, а также поддерживает fine-tuning через готовые рецепты и инструменты вроде tml-renderer. Её веса опубликованы на Hugging Face, включая оптимизированную версию для NVIDIA Blackwell. Партнёры вроде Together, Fireworks, vLLM, llama.cpp и Hugging Face обеспечивают широкую совместимость. Одновременно выпущена упрощённая версия Inkling-Small (12 млрд активных параметров) для низколатентных задач. Это первый шаг в семействе моделей, созданных для того, чтобы пользователи могли делать их своими — не просто использовать, а перестраивать.
Комментарии (267)
Тред подтверждает, что Inkling — это перспективная мультимодальная модель с открытыми весами, которая может быть конкурентоспособной на рынке open-weight моделей, но её возможности и ограничения ещё требуют практического тестирования и сравнения.
-
Inkling может быть сильным конкурентом среди open-weight моделей, особенно в задачах, где важна мультимодальность и эффективность вычислений.
-
Спор: Некоторые пользователи сомневаются в конкурентоспособности Inkling по сравнению с другими моделями, такими как GLM5.2 и DeepSeek, в то время как другие считают, что она имеет потенциал благодаря своей мультимодальности и эффективности.
-
Совет: Пользователи советуют обратить внимание на возможность тонкой настройки Inkling для конкретных задач, что может сделать её более эффективной и экономически выгодной.
-
Inkling — это важный шаг в развитии open-weight моделей, и её появление может стимулировать дальнейшее развитие и конкуренцию на рынке.
-
Спор: Некоторые пользователи обсуждают licensing модель и доступность весов для Inkling, что может повлиять на её использование и распространение.
Open base models that can be fine tuned on Tinker is a great business model IMO. You (i.e. an enterprise) can own your own model & have it perform frontier-or-better at your task at potentially much lower cost and Thinking Machines gets to be your essential infra/service provider in this world. — @wxw
I regret building this $3000 Pi AI cluster 🔥 Горячее 💬 Длинная дискуссия
Создание кластера из 10 Raspberry Pi CM5 за $3000 оказалось спорным решением. Хотя сборка обеспечила 160 ГБ оперативной памяти и 10-кратный прирост производительности в тесте HPL (325 Gflops при 130 Вт), энергоэффективность лишь ненамного превзошла более мощный кластер на базе Framework. Основная проблема — неспособность использовать iGPU для ускорения AI через Vulkan в llama.cpp, что ограничило инференс моделей медленными CPU. Попытка запуска крупной модели Llama 3.3:70B провалилась: кластер не справился даже с генерацией 16 токенов из-за архитектурных ограничений распределённой обработки.
Практический вывод: такие системы подходят лишь для узких сценариев параллельных вычислений, но бесполезны для современных AI-задач. Автор отмечает, что за два года ожидания поставки железо устарело, а альтернативы вроде Xerxes Pi на Kickstarter лишь повторяют эту рискованную модель.
Комментарии (294)
- Сборка кластера из Raspberry Pi рассматривается как дорогостоящее и непрактичное, но интересное для обучения и экспериментов хобби, а не как эффективное решение для высокопроизводительных вычислений.
- Для серьёзных задач ИИ и распределённых систем рекомендуется использовать мощные CPU/GPU, виртуализацию или аренду облачных ресурсов, а не низкопроизводительные одноплатные компьютеры.
- Кластеры на Raspberry Pi могут быть полезны для образовательных целей, тестирования программных интерфейсов (например, MPI, Kubernetes) и управления лёгкими контейнерами, но не для нагрузок, требующих высокой пропускной способности или вычислений.
- Экономическая нецелесообразность сборки кластера из Pi для производительности подчёркивается высокой стоимостью, низкой эффективностью и доступностью более мощных и дешёвых альтернатив (например, GPU, NUC, MacBook).
- Автор исходного обсуждения получил ценный опыт и материалы для контента, но проект не оправдал ожиданий по производительности, особенно в задачах LLM-инференса.
Open models by OpenAI 🔥 Горячее 💬 Длинная дискуссия
Открытые модели OpenAI
Продвинутые модели с открытыми весами для любого кейса и запуска где угодно.
Ссылки:
- Загрузить на Hugging Face
- Исходники на GitHub
- Попробовать демо
Модели:
- gpt-oss-120b — крупная модель для дата-центров и мощных ПК/ноутбуков.
- gpt-oss-20b — средняя модель, работает на большинстве ПК/ноутбуков.
Преимущества:
- Разрешительная лицензия: Apache 2.0 — свободная разработка, без копилефта и патентных рисков; подходит для экспериментов, кастомизации и коммерческого использования.
- Для агентных задач: сильное следование инструкциям и работа с инструментами в ходе рассуждений (веб-поиск, запуск Python-кода).
- Глубокая настраиваемость: выбор уровня «усилия рассуждений» (низкий/средний/высокий) и полно-параметрический финтюнинг под ваш кейс.
- Полная «цепочка рассуждений»: доступна для удобной отладки и повышения доверия к ответам.
Интерактивное демо:
- Простой playground для запуска обеих моделей в браузере.
Комментарии (845)
- Обсуждение посвящено выходу открытых моделей OpenAI gpt-oss (20B и 120B), которые по бенчмаркам близки к o3/o4-mini и местами обгоняют открытые лидеры; многие отмечают, что 20B уже реально запускается локально на Mac/мобильных устройствах.
- Пользователи делятся первыми впечатлениями и ссылками на обзоры/модель-карты, отмечая конкурентную производительность, совместимый токенайзер и адекватное лицензирование; есть поддержка в llama.cpp, Ollama, LM Studio, Harmony формат ответов и растущая роль Rust в инструментах OpenAI.
- Скорости инференса сильно варьируются: от очень быстрых облачных провайдеров (Cerebras/Groq на OpenRouter) до заметных задержек локально при больших контекстах; производительность зависит от GPU/платформы и параметров квантования.
- Отмечают стратегический сдвиг OpenAI к модели Meta: открытые веса как средство захвата экосистемы и снижения порога входа; звучат предположения, что релиз предвосхищает скорый анонс ещё более сильной закрытой модели.
- Сообщество обсуждает экономику: гибридные пайплайны (локально — простые задачи, в облако — сложные), возможность заменять платные подписки локальным запуском, и общий тренд в пользу OSS при минимальной разнице в качестве.
- Есть критика: у 120B встречаются галлюцинации на фактах, часть пользователей недовольна агрессивной безопасностью/отказами, отсутствием оптимизаций под RTX 50, а также неполной мультимодальностью.
- В целом настроение позитивное: многие благодарят за «настоящий» открытый релиз с сопутствующими инструментами и ожидают независимых бенчмарков, которые могут закрепить лидерство gpt-oss среди текстовых открытых моделей.