Why your local LLM feels dumber than it is 🔥 Горячее 💬 Длинная дискуссия
Локальный LLM часто кажется «глупым», хотя модель теоретически способна на большее. Причина — различия в реализации вывода: каждый набор железа и программного обеспечения (GPU‑архитектура, драйверы, библиотеки) вычисляет логиты по‑своему, а небольшие отклонения в вероятностях следующего токена приводят к заметно другим результатам.
Ключевой эксперимент сравнил пять вариантов квантования (W8A16, FP8, INT8, AWQ W4A16, NVFP4) на одинаковом наборе весов. Самый «умный» вариант — W8A16 — показал наименьшее количество переключений токенов (≈ 5 % при 88 k контекста), тогда как NVFP4 отставал с ~50 % ошибок. Кроме того, только FP8 и INT8 корректно выполнили цепочку команд Cisco, остальные сгенерировали «show run» вместо правильного «show arp». Эти данные подтверждают, что даже при одинаковых весах результат сильно зависит от выбранного бэкенда и настроек декодера.
Запомните: небольшие изменения в logits → кардинальные различия в поведении; правильный sampler (temp ≈ 1.0, top‑p ≈ 0.95) и совместимый attention‑kernel (например, Triton ATTN) могут вернуть до 50 % точности, а неправильный набор параметров делает модель «глухой».
Комментарии (152)
Тред подтверждает, что качество моделей чаще страдает от ошибок конфигурации, чем от алгоритмов квантования: потеря chat-template в GGUF приводит к молчаливому падению рантайма на ChatML, а агрессивное сжатие KV-cache — к потере логики. Рекомендуется проверять токены шаблона перед обвинением модели. Для сохранения точности избегайте квантования KV-cache — используйте не хуже Q8, жертвуя скоростью. Даже Q4-квантованные модели (например, Qwen 3.8 27B) могут работать на уровне Gemini Flash при мощном железе (RTX 5090, M4 Pro), но стабильность зависит от рантайма. Споры о качестве Qwen 3.8 27B: @tharkun__ успешно использовал её на слабом железе, @velcrovan столкнулся с крахами на M4 Pro. llama.cpp и ik_llama.cpp предотвращают ошибки tool calls за счёт грамматического принуждения — функция недоступна в некоторых рантаймах. Ollama критикуют за недостаточное признание авторов llama.cpp, но остаётся удобным выбором для Windows из-за проблем с VLLM. Дефолтное квантование в популярных рантаймах деградирует логику по сравнению с FP16, особенно на длинных контекстах. Тяжёлые модели (Qwen 3.8 27B/37B) успешно запускаются на локальных GPU (5090, M4 Pro) с высокой скоростью (до 800 TPS на RTX 5090 с ninfer), подтверждая возможность локального инференса.
Qwen 3.8 27B 🔥 Горячее 💬 Длинная дискуссия
Qwen3.8-27B — новая модель из семейства Qwen с 27 млрд параметров, оптимизированная под FP8-квантование с блоком 128, сохраняющая почти полную точность оригинала. Она сочетает мощь в кодировании, научных задачах и агентных сценариях с поддержкой видеопонимания и гибким контролем рассуждений через параметры reasoning_effort и preserve_thinking. Модель нативно обрабатывает изображения и видео до часа длиной, а контекст поддерживается до 1 млн токенов — в развернутой версии на Qwen Cloud.
Технически, архитектура включает 64 слоя с гейтед DeltaNet и Gated Attention, а также MTP для многотокенного предсказания. В бенчмарках она превосходит предшественников: 73% на Terminal Bench 2.1 (против 63,4% у Qwen3.6) и 61,7% на SWE-bench Pro. Для длинных контекстов рекомендуется настраивать rope_parameters с фактором 2.0 при 524K токенов, а для видео — увеличить longest_edge до 469M для высокой частоты кадров. Модель совместима с vLLM, SGLang и другими фреймворками, а готовая облачная версия с инструментами и 1M контекстом выйдет вскоре.
Комментарии (722)
Qwen 3.8 27B демонстрирует качество, сопоставимое с Opus 4.6, в кодировании и генерации SVG (подтверждено @CMay, @simonw, @swalsh на Mac M5, RTX 3090/4090), но страдает от низкой эффективности: высокое потребление VRAM, медленная генерация и склонность к «переосмыслению» — тратит в 10 раз больше токенов, чем Gemma 4, часто зацикливаясь в режиме xhigh reasoning. @RandyOrion и @c7b утверждают, что качество напрямую зависит от усилий размышления, тогда как @Casteil и @dofm считают это избыточным. Для контроля поведения рекомендуют явно задавать `--chat-template-kwargs '{"preserve_thinking":true,"reasoning_effort":"medium"}'` или использовать шаблоны Jinja от @froggeric. Для ускорения инференса: на RTX 5090 — ninfer (~138 tok/s), на RTX 4090 — оптимизированный llama.cpp с MTP и flash-attn (@hypfer). VRAM-потребление неэффективно: 32K контекста — 2.5 ГБ, 128K не загружается даже при Q4_0 (в отличие от Gemma 4/Muse Glimmer). Квантованные версии от Unsloth (Q8kxl) зацикливаются — стабильнее версии от bartowski в llama.cpp. В немецком языке прогресс минимальный, с регрессиями, уступает Gemini Flash Lite (@scirob). Для бюджетного запуска — Intel B70 с 32 ГБ VRAM за $1500 (@Almondsetat). Модель корректно генерирует JS-приложения и минимизирует ошибки при портировании на Rust/Tauri (@dexterlagan). 1-битное квантование позволяет запустить на 16 ГБ Mac Mini, но требует перезапуска сессии при смене режимов plan/act (@jedbrooke).
Show HN: Needle2: 14MB agentic LLM for phones, wearables, smart home and robots 🔥 Горячее
Needle 2 — 45‑млн‑параметрическая модель, упакованная в 14 МБ и работающая в 28 МБ ОЗУ. Она использует CQ2‑бит квантование Cactus Quants и собственную инференс‑движок, поддерживает генерацию до 500 токенов/сек на Raspberry Pi 5 и 400‑1500 токенов/сек на VR‑устройствах. Благодаря такой лёгкости её можно запускать на микроконтроллерах (ESP32‑S3), смартфонах за $200 и других «тонких» платформах, где нет GPU и NPU.
Главная идея — перевести сложные задачи (вызов функций, извлечение схемы) в небольшие, предсказуемые операции без «мудрёного» контекста. Каждый ответ оформляется как «оболочка вызова», пустой вызов — отказ, а точный контракт гарантирует, что модель лишь выбирает нужную функцию и её параметры. Это позволяет 45‑млн‑модель конкурировать с 200‑млн‑парметрическими аналогами в задачах управления умным домом, роботами и мобильными приложениями, а при низкой уверенности она передаёт запрос в облако, сохраняя приватность и экономию ресурсов. Ключевые цифры: 14 МБ файл, 28 МБ RAM, 500 токенов/сек на Pi 5, поддержка CQ2‑бит без потери качества.
Комментарии (134)
Тред дополняет статью информацией о возможностях и ограничениях модели Needle 2, её применении и проблемах использования. Некоторые пользователи отмечают её полезность для локальных задач — например, управления умным домом или робототехникой — но указывают на ограничения в обработке сложных запросов, особенно связанных с навигацией и манипуляцией объектами. Есть споры: одни считают модель слишком малой, другие — подходящей для узких задач. Рекомендуется проводить дополнительную настройку, тестирование и рассматривать сочетание Needle 2 с более крупными моделями для решения сложных задач.
Muse Glimmer: 30B-parameter model optimized for always-on local agent workflows 🔥 Горячее 💬 Длинная дискуссия
Muse Glimmer — 30‑модель с открытыми весами, предназначенная для работы агентов непосредственно на вашем устройстве. Она умеет планировать расписание, писать сообщения, организовывать файлы и учиться вашему стилю работы, используя длительные контексты, точный вызов инструментов и многомодальное понимание. Благодаря эффективному дистилляционному рецепту и оптимизациям (квантование, DFlash‑спекулятивное декодирование) модель укладывается в память обычного ноутбука или ПК с одной видеокартой и генерирует ответы в реальном времени.
Ключевые возможности: — полноценное выполнение задач (DeepSearch QA, MCP‑Atlas, 𝛕‑Bench, SWE‑Bench); — надёжный вызов функций в длительных цепочках; — цепочки рассуждений длиной в несколько шагов; — восстановление после ошибок инструментов. На MacBook M4‑Max, M5‑Max и RTX 5090 скорость декодирования ускоряется в 1,5–3,1 раза благодаря DFlash. Веса модели уже доступны на Hugging Face, а в ближайшее время появятся интеграции с llama.cpp, MLX, ExecuTorch и партнёрами (Ollama, LM Studio и др.), что позволит быстро запустить собственного локального агента.
Комментарии (526)
Тред дополняет статью практическим опытом использования Muse Glimmer, сравнениями с другими моделями (например, Qwen3.6 27B), техническими деталями и потенциальными применениями. Пользователи отмечают хорошую работу модели, но требуют 32–64 ГБ ОЗУ. Рекомендуют оптимизации — квантование и DFlash-спекуляция — для улучшения производительности на слабых устройствах. Модель применима для планирования, написания сообщений, организации файлов и адаптации к стилю пользователя. Указываются ограничения: высокие требования к памяти и возможные проблемы с производительностью на устройствах с ограниченными ресурсами.
Qwen3 30B A3B Hits 13 token/s on 4xRaspberry Pi 5 🔥 Горячее
Qwen3 30B A3B Q40 на 4×Raspberry Pi 5 8 ГБ
- 30-миллиардная модель запущена на кластере из четырёх Pi 5.
- Использован формат Q40 (40% квантование), суммарно ~19 ГБ ОЗУ.
- Скорость генерации: 1,1 токен/с при 128-к контексте.
- Сеть — Gigabit Ethernet, трафик между узлами 200–300 Мбит/с.
- Питание: 5 В 5 А на каждую плату, общая мощность ≈ 60 Вт.
- Охлаждение: радиаторы + 30-мм вентиляторы, температура 60–65 °C.
- Проект полностью open-source, собран за 2 часа.
Комментарии (131)
- На кластере из 4×Raspberry Pi 5 запустили 30B-MoE-модель (3B активных параметров) и получили 13 токен/с при 4-битной квантизации.
- Участники сравнили цену/производительность с GPU, старыми x86-мини-ПК и RK3588-SBC: у Pi самая низкая энергоэффективность и дороговато за такую скорость.
- Главный интерес — «доказательство концепции» распределённого инференса: tensor-parallelism по Ethernet, максимум узлов = числу KV-голов модели.
- Сеть (1 Gb/s) пока не узкое место, но рост требует 2ⁿ узлов и сталкивается с латентностью и NUMA-эффектами.
- Кому-то идея нравится как дешёвый edge-LLM без интернета, другие считают проект игрушкой и советуют докупить used GPU или M4-Mac mini.