Hacker News Digest

Тег: #quantization

Постов: 5

Why your local LLM feels dumber than it is (forum.level1techs.com) 🔥 Горячее 💬 Длинная дискуссия

Локальный LLM часто кажется «глупым», хотя модель теоретически способна на большее. Причина — различия в реализации вывода: каждый набор железа и программного обеспечения (GPU‑архитектура, драйверы, библиотеки) вычисляет логиты по‑своему, а небольшие отклонения в вероятностях следующего токена приводят к заметно другим результатам.

Ключевой эксперимент сравнил пять вариантов квантования (W8A16, FP8, INT8, AWQ W4A16, NVFP4) на одинаковом наборе весов. Самый «умный» вариант — W8A16 — показал наименьшее количество переключений токенов (≈ 5 % при 88 k контекста), тогда как NVFP4 отставал с ~50 % ошибок. Кроме того, только FP8 и INT8 корректно выполнили цепочку команд Cisco, остальные сгенерировали «show run» вместо правильного «show arp». Эти данные подтверждают, что даже при одинаковых весах результат сильно зависит от выбранного бэкенда и настроек декодера.

Запомните: небольшие изменения в logits → кардинальные различия в поведении; правильный sampler (temp ≈ 1.0, top‑p ≈ 0.95) и совместимый attention‑kernel (например, Triton ATTN) могут вернуть до 50 % точности, а неправильный набор параметров делает модель «глухой».

by felineflock • 22 августа 2026 г. в 18:14 • 392 points

ОригиналHN

#attention#awq#fp8#gpu#int8#logits#nvfp4#quantization#sampler#triton

Комментарии (152)

Тред подтверждает, что качество моделей чаще страдает от ошибок конфигурации, чем от алгоритмов квантования: потеря chat-template в GGUF приводит к молчаливому падению рантайма на ChatML, а агрессивное сжатие KV-cache — к потере логики. Рекомендуется проверять токены шаблона перед обвинением модели. Для сохранения точности избегайте квантования KV-cache — используйте не хуже Q8, жертвуя скоростью. Даже Q4-квантованные модели (например, Qwen 3.8 27B) могут работать на уровне Gemini Flash при мощном железе (RTX 5090, M4 Pro), но стабильность зависит от рантайма. Споры о качестве Qwen 3.8 27B: @tharkun__ успешно использовал её на слабом железе, @velcrovan столкнулся с крахами на M4 Pro. llama.cpp и ik_llama.cpp предотвращают ошибки tool calls за счёт грамматического принуждения — функция недоступна в некоторых рантаймах. Ollama критикуют за недостаточное признание авторов llama.cpp, но остаётся удобным выбором для Windows из-за проблем с VLLM. Дефолтное квантование в популярных рантаймах деградирует логику по сравнению с FP16, особенно на длинных контекстах. Тяжёлые модели (Qwen 3.8 27B/37B) успешно запускаются на локальных GPU (5090, M4 Pro) с высокой скоростью (до 800 TPS на RTX 5090 с ninfer), подтверждая возможность локального инференса.

Qwen 3.8 27B (huggingface.co) 🔥 Горячее 💬 Длинная дискуссия

Qwen3.8-27B — новая модель из семейства Qwen с 27 млрд параметров, оптимизированная под FP8-квантование с блоком 128, сохраняющая почти полную точность оригинала. Она сочетает мощь в кодировании, научных задачах и агентных сценариях с поддержкой видеопонимания и гибким контролем рассуждений через параметры reasoning_effort и preserve_thinking. Модель нативно обрабатывает изображения и видео до часа длиной, а контекст поддерживается до 1 млн токенов — в развернутой версии на Qwen Cloud.

Технически, архитектура включает 64 слоя с гейтед DeltaNet и Gated Attention, а также MTP для многотокенного предсказания. В бенчмарках она превосходит предшественников: 73% на Terminal Bench 2.1 (против 63,4% у Qwen3.6) и 61,7% на SWE-bench Pro. Для длинных контекстов рекомендуется настраивать rope_parameters с фактором 2.0 при 524K токенов, а для видео — увеличить longest_edge до 469M для высокой частоты кадров. Модель совместима с vLLM, SGLang и другими фреймворками, а готовая облачная версия с инструментами и 1M контекстом выйдет вскоре.

by erdaltoprak • 14 августа 2026 г. в 15:00 • 1209 points

ОригиналHN

#fp8#huggingface#machine-learning#nlp#quantization#qwen#sglang#vllm

Комментарии (722)

Qwen 3.8 27B демонстрирует качество, сопоставимое с Opus 4.6, в кодировании и генерации SVG (подтверждено @CMay, @simonw, @swalsh на Mac M5, RTX 3090/4090), но страдает от низкой эффективности: высокое потребление VRAM, медленная генерация и склонность к «переосмыслению» — тратит в 10 раз больше токенов, чем Gemma 4, часто зацикливаясь в режиме xhigh reasoning. @RandyOrion и @c7b утверждают, что качество напрямую зависит от усилий размышления, тогда как @Casteil и @dofm считают это избыточным. Для контроля поведения рекомендуют явно задавать `--chat-template-kwargs '{"preserve_thinking":true,"reasoning_effort":"medium"}'` или использовать шаблоны Jinja от @froggeric. Для ускорения инференса: на RTX 5090 — ninfer (~138 tok/s), на RTX 4090 — оптимизированный llama.cpp с MTP и flash-attn (@hypfer). VRAM-потребление неэффективно: 32K контекста — 2.5 ГБ, 128K не загружается даже при Q4_0 (в отличие от Gemma 4/Muse Glimmer). Квантованные версии от Unsloth (Q8kxl) зацикливаются — стабильнее версии от bartowski в llama.cpp. В немецком языке прогресс минимальный, с регрессиями, уступает Gemini Flash Lite (@scirob). Для бюджетного запуска — Intel B70 с 32 ГБ VRAM за $1500 (@Almondsetat). Модель корректно генерирует JS-приложения и минимизирует ошибки при портировании на Rust/Tauri (@dexterlagan). 1-битное квантование позволяет запустить на 16 ГБ Mac Mini, но требует перезапуска сессии при смене режимов plan/act (@jedbrooke).

Show HN: Needle2: 14MB agentic LLM for phones, wearables, smart home and robots (cactuscompute.com) 🔥 Горячее

Needle 2 — 45‑млн‑параметрическая модель, упакованная в 14 МБ и работающая в 28 МБ ОЗУ. Она использует CQ2‑бит квантование Cactus Quants и собственную инференс‑движок, поддерживает генерацию до 500 токенов/сек на Raspberry Pi 5 и 400‑1500 токенов/сек на VR‑устройствах. Благодаря такой лёгкости её можно запускать на микроконтроллерах (ESP32‑S3), смартфонах за $200 и других «тонких» платформах, где нет GPU и NPU.

Главная идея — перевести сложные задачи (вызов функций, извлечение схемы) в небольшие, предсказуемые операции без «мудрёного» контекста. Каждый ответ оформляется как «оболочка вызова», пустой вызов — отказ, а точный контракт гарантирует, что модель лишь выбирает нужную функцию и её параметры. Это позволяет 45‑млн‑модель конкурировать с 200‑млн‑парметрическими аналогами в задачах управления умным домом, роботами и мобильными приложениями, а при низкой уверенности она передаёт запрос в облако, сохраняя приватность и экономию ресурсов. Ключевые цифры: 14 МБ файл, 28 МБ RAM, 500 токенов/сек на Pi 5, поддержка CQ2‑бит без потери качества.

by HenryNdubuaku • 10 августа 2026 г. в 17:22 • 353 points

ОригиналHN

#cactus-quants#cactuscompute#esp32#inference-engine#llm#needle2#quantization#raspberry-pi#robots#smart-home

Комментарии (134)

Тред дополняет статью информацией о возможностях и ограничениях модели Needle 2, её применении и проблемах использования. Некоторые пользователи отмечают её полезность для локальных задач — например, управления умным домом или робототехникой — но указывают на ограничения в обработке сложных запросов, особенно связанных с навигацией и манипуляцией объектами. Есть споры: одни считают модель слишком малой, другие — подходящей для узких задач. Рекомендуется проводить дополнительную настройку, тестирование и рассматривать сочетание Needle 2 с более крупными моделями для решения сложных задач.

Muse Glimmer: 30B-parameter model optimized for always-on local agent workflows (research.meta.ai) 🔥 Горячее 💬 Длинная дискуссия

Muse Glimmer — 30‑модель с открытыми весами, предназначенная для работы агентов непосредственно на вашем устройстве. Она умеет планировать расписание, писать сообщения, организовывать файлы и учиться вашему стилю работы, используя длительные контексты, точный вызов инструментов и многомодальное понимание. Благодаря эффективному дистилляционному рецепту и оптимизациям (квантование, DFlash‑спекулятивное декодирование) модель укладывается в память обычного ноутбука или ПК с одной видеокартой и генерирует ответы в реальном времени.

Ключевые возможности: — полноценное выполнение задач (DeepSearch QA, MCP‑Atlas, 𝛕‑Bench, SWE‑Bench); — надёжный вызов функций в длительных цепочках; — цепочки рассуждений длиной в несколько шагов; — восстановление после ошибок инструментов. На MacBook M4‑Max, M5‑Max и RTX 5090 скорость декодирования ускоряется в 1,5–3,1 раза благодаря DFlash. Веса модели уже доступны на Hugging Face, а в ближайшее время появятся интеграции с llama.cpp, MLX, ExecuTorch и партнёрами (Ollama, LM Studio и др.), что позволит быстро запустить собственного локального агента.

by riordan • 10 августа 2026 г. в 10:10 • 940 points

ОригиналHN

#dflash#executorch#huggingface#llama.cpp#lm-studio#meta#mlx#muse-glimmer#ollama#quantization

Комментарии (526)

Тред дополняет статью практическим опытом использования Muse Glimmer, сравнениями с другими моделями (например, Qwen3.6 27B), техническими деталями и потенциальными применениями. Пользователи отмечают хорошую работу модели, но требуют 32–64 ГБ ОЗУ. Рекомендуют оптимизации — квантование и DFlash-спекуляция — для улучшения производительности на слабых устройствах. Модель применима для планирования, написания сообщений, организации файлов и адаптации к стилю пользователя. Указываются ограничения: высокие требования к памяти и возможные проблемы с производительностью на устройствах с ограниченными ресурсами.

Qwen3 30B A3B Hits 13 token/s on 4xRaspberry Pi 5 (github.com) 🔥 Горячее

Qwen3 30B A3B Q40 на 4×Raspberry Pi 5 8 ГБ

  • 30-миллиардная модель запущена на кластере из четырёх Pi 5.
  • Использован формат Q40 (40% квантование), суммарно ~19 ГБ ОЗУ.
  • Скорость генерации: 1,1 токен/с при 128-к контексте.
  • Сеть — Gigabit Ethernet, трафик между узлами 200–300 Мбит/с.
  • Питание: 5 В 5 А на каждую плату, общая мощность ≈ 60 Вт.
  • Охлаждение: радиаторы + 30-мм вентиляторы, температура 60–65 °C.
  • Проект полностью open-source, собран за 2 часа.

by b4rtazz • 06 сентября 2025 г. в 10:59 • 311 points

ОригиналHN

#distributed-computing#edge-computing#gigabit-ethernet#github#llm#open-source#quantization#raspberry-pi#tensor-parallelism

Комментарии (131)

  • На кластере из 4×Raspberry Pi 5 запустили 30B-MoE-модель (3B активных параметров) и получили 13 токен/с при 4-битной квантизации.
  • Участники сравнили цену/производительность с GPU, старыми x86-мини-ПК и RK3588-SBC: у Pi самая низкая энергоэффективность и дороговато за такую скорость.
  • Главный интерес — «доказательство концепции» распределённого инференса: tensor-parallelism по Ethernet, максимум узлов = числу KV-голов модели.
  • Сеть (1 Gb/s) пока не узкое место, но рост требует 2ⁿ узлов и сталкивается с латентностью и NUMA-эффектами.
  • Кому-то идея нравится как дешёвый edge-LLM без интернета, другие считают проект игрушкой и советуют докупить used GPU или M4-Mac mini.