Why your local LLM feels dumber than it is 🔥 Горячее 💬 Длинная дискуссия
Локальный LLM часто кажется «глупым», хотя модель теоретически способна на большее. Причина — различия в реализации вывода: каждый набор железа и программного обеспечения (GPU‑архитектура, драйверы, библиотеки) вычисляет логиты по‑своему, а небольшие отклонения в вероятностях следующего токена приводят к заметно другим результатам.
Ключевой эксперимент сравнил пять вариантов квантования (W8A16, FP8, INT8, AWQ W4A16, NVFP4) на одинаковом наборе весов. Самый «умный» вариант — W8A16 — показал наименьшее количество переключений токенов (≈ 5 % при 88 k контекста), тогда как NVFP4 отставал с ~50 % ошибок. Кроме того, только FP8 и INT8 корректно выполнили цепочку команд Cisco, остальные сгенерировали «show run» вместо правильного «show arp». Эти данные подтверждают, что даже при одинаковых весах результат сильно зависит от выбранного бэкенда и настроек декодера.
Запомните: небольшие изменения в logits → кардинальные различия в поведении; правильный sampler (temp ≈ 1.0, top‑p ≈ 0.95) и совместимый attention‑kernel (например, Triton ATTN) могут вернуть до 50 % точности, а неправильный набор параметров делает модель «глухой».
Комментарии (152)
Тред подтверждает, что качество моделей чаще страдает от ошибок конфигурации, чем от алгоритмов квантования: потеря chat-template в GGUF приводит к молчаливому падению рантайма на ChatML, а агрессивное сжатие KV-cache — к потере логики. Рекомендуется проверять токены шаблона перед обвинением модели. Для сохранения точности избегайте квантования KV-cache — используйте не хуже Q8, жертвуя скоростью. Даже Q4-квантованные модели (например, Qwen 3.8 27B) могут работать на уровне Gemini Flash при мощном железе (RTX 5090, M4 Pro), но стабильность зависит от рантайма. Споры о качестве Qwen 3.8 27B: @tharkun__ успешно использовал её на слабом железе, @velcrovan столкнулся с крахами на M4 Pro. llama.cpp и ik_llama.cpp предотвращают ошибки tool calls за счёт грамматического принуждения — функция недоступна в некоторых рантаймах. Ollama критикуют за недостаточное признание авторов llama.cpp, но остаётся удобным выбором для Windows из-за проблем с VLLM. Дефолтное квантование в популярных рантаймах деградирует логику по сравнению с FP16, особенно на длинных контекстах. Тяжёлые модели (Qwen 3.8 27B/37B) успешно запускаются на локальных GPU (5090, M4 Pro) с высокой скоростью (до 800 TPS на RTX 5090 с ninfer), подтверждая возможность локального инференса.
A walk through of the DeltaNet family of linear attention variants 🔥 Горячее
В статье показано, как простые предположения о скрытом состоянии приводят к формуле линейного внимания, известной как Kimi Delta Attention (KDA), которая вытекает из семейства DeltaNet и используется в моделях Qwen и Kimi. Ключевой приём — заменить softmax на умножение на деградирующие матрицы и добавить корректирующий вектор ошибки, что позволяет обновлять состояние рекуррентно и хранить лишь текущий стейт. При этом запросы масштабируются по (d_k^{-1/2}), а ключи нормализованы, чтобы их внутреннее произведение оставалось в пределах одного скаляра. Такой подход превращает квадратичную зависимость от длины последовательности в линейную, а также делает возможным кэширование ключей и значений без роста памяти.
В результате получаем O(1) память и возможность обрабатывать запросы за константное время, а также β‑параметр, задающий экспоненциальный спад, который делает внимание устойчивым к очень длинным контекстам. Реализация KDA в Triton использует кусочные схемы: внутри чанка вычисляются диагональные взаимодействия, а между ними решается триангулярная система, что позволяет параллелить расчёты на GPU. Такой подход лежит в основе эффективного прямого прохода, используемого в последних версиях Qwen и Kimi, и демонстрирует, как простая идея о скрытом состоянии может породить мощный линейный механизм внимания.
Комментарии (106)
Тред обсуждает сложность и интуитивность математической нотации в статье, а также доступность понимания машинного обучения и линейного внимания. Многие находят нотацию запутанной, но некоторые — полезной и ясной. Пользователи делятся трудностями в освоении темы, предлагают ресурсы и примеры, выражают благодарность за обмен опытом. Споры идут о степени сложности разработки линейного внимания и Kimi Delta Attention: одни считают их несложными, другие — требующими глубоких знаний. Некоторые сомневаются в их новизне, называя их комбинацией существующих идей. @dr_kretyn рекомендует bra-ket нотацию как более интуитивную, особенно для физиков.
Fp8 runs ~100 tflops faster when the kernel name has "cutlass" in it 🔥 Горячее
В пул-реквесте к Triton представлена реализация механизма persistent attention для ускорения работы с большими контекстами в трансформерах. Вместо пересчета ключей и значений для каждого токена механизм сохраняет их в глобальной памяти, что значительно снижает вычислительную нагрузку при обработке длинных последовательностей.
Автор демонстрирует, как это позволяет эффективно работать с контекстами до 128K токенов, избегая квадратичной сложности традиционного внимания. Практический вывод: такой подход открывает путь к более масштабным моделям без пропорционального роста затрат на вычисления.
Комментарии (141)
- NVIDIA использует хардкод для оптимизации кода, содержащего "cutlass" в названии, что может быть нестабильным и приводить к скрытым багам.
- Подобные практики (оптимизации по именам функций или приложений) исторически распространены среди производителей железа и софта (ATI/AMD, Intel, Microsoft) для улучшения бенчмарков, иногда в ущерб качеству.
- Мотивация таких оптимизаций часто не злонамеренна, а связана с снижением рисков и фокусом на стабильности собственных библиотек, но создаёт новые барьеры.
- В индустрии существуют разногласия по поводу этичности таких практик, но для графических драйверов тюнинг под конкретные игры стал нормой.
- Обсуждаются проблемы проприетарного кода (драйверы, прошивки) и затраты общества на обратную разработку вместо сотрудничества.