Hacker News Digest

Тег: #triton

Постов: 3

Why your local LLM feels dumber than it is (forum.level1techs.com) 🔥 Горячее 💬 Длинная дискуссия

Локальный LLM часто кажется «глупым», хотя модель теоретически способна на большее. Причина — различия в реализации вывода: каждый набор железа и программного обеспечения (GPU‑архитектура, драйверы, библиотеки) вычисляет логиты по‑своему, а небольшие отклонения в вероятностях следующего токена приводят к заметно другим результатам.

Ключевой эксперимент сравнил пять вариантов квантования (W8A16, FP8, INT8, AWQ W4A16, NVFP4) на одинаковом наборе весов. Самый «умный» вариант — W8A16 — показал наименьшее количество переключений токенов (≈ 5 % при 88 k контекста), тогда как NVFP4 отставал с ~50 % ошибок. Кроме того, только FP8 и INT8 корректно выполнили цепочку команд Cisco, остальные сгенерировали «show run» вместо правильного «show arp». Эти данные подтверждают, что даже при одинаковых весах результат сильно зависит от выбранного бэкенда и настроек декодера.

Запомните: небольшие изменения в logits → кардинальные различия в поведении; правильный sampler (temp ≈ 1.0, top‑p ≈ 0.95) и совместимый attention‑kernel (например, Triton ATTN) могут вернуть до 50 % точности, а неправильный набор параметров делает модель «глухой».

by felineflock • 22 августа 2026 г. в 18:14 • 392 points

ОригиналHN

#attention#awq#fp8#gpu#int8#logits#nvfp4#quantization#sampler#triton

Комментарии (152)

Тред подтверждает, что качество моделей чаще страдает от ошибок конфигурации, чем от алгоритмов квантования: потеря chat-template в GGUF приводит к молчаливому падению рантайма на ChatML, а агрессивное сжатие KV-cache — к потере логики. Рекомендуется проверять токены шаблона перед обвинением модели. Для сохранения точности избегайте квантования KV-cache — используйте не хуже Q8, жертвуя скоростью. Даже Q4-квантованные модели (например, Qwen 3.8 27B) могут работать на уровне Gemini Flash при мощном железе (RTX 5090, M4 Pro), но стабильность зависит от рантайма. Споры о качестве Qwen 3.8 27B: @tharkun__ успешно использовал её на слабом железе, @velcrovan столкнулся с крахами на M4 Pro. llama.cpp и ik_llama.cpp предотвращают ошибки tool calls за счёт грамматического принуждения — функция недоступна в некоторых рантаймах. Ollama критикуют за недостаточное признание авторов llama.cpp, но остаётся удобным выбором для Windows из-за проблем с VLLM. Дефолтное квантование в популярных рантаймах деградирует логику по сравнению с FP16, особенно на длинных контекстах. Тяжёлые модели (Qwen 3.8 27B/37B) успешно запускаются на локальных GPU (5090, M4 Pro) с высокой скоростью (до 800 TPS на RTX 5090 с ninfer), подтверждая возможность локального инференса.

A walk through of the DeltaNet family of linear attention variants (blog.doubleword.ai) 🔥 Горячее

В статье показано, как простые предположения о скрытом состоянии приводят к формуле линейного внимания, известной как Kimi Delta Attention (KDA), которая вытекает из семейства DeltaNet и используется в моделях Qwen и Kimi. Ключевой приём — заменить softmax на умножение на деградирующие матрицы и добавить корректирующий вектор ошибки, что позволяет обновлять состояние рекуррентно и хранить лишь текущий стейт. При этом запросы масштабируются по (d_k^{-1/2}), а ключи нормализованы, чтобы их внутреннее произведение оставалось в пределах одного скаляра. Такой подход превращает квадратичную зависимость от длины последовательности в линейную, а также делает возможным кэширование ключей и значений без роста памяти.

В результате получаем O(1) память и возможность обрабатывать запросы за константное время, а также β‑параметр, задающий экспоненциальный спад, который делает внимание устойчивым к очень длинным контекстам. Реализация KDA в Triton использует кусочные схемы: внутри чанка вычисляются диагональные взаимодействия, а между ними решается триангулярная система, что позволяет параллелить расчёты на GPU. Такой подход лежит в основе эффективного прямого прохода, используемого в последних версиях Qwen и Kimi, и демонстрирует, как простая идея о скрытом состоянии может породить мощный линейный механизм внимания.

by AnhTho_FR • 28 июля 2026 г. в 16:02 • 251 points

ОригиналHN

#deltaattention#deltanet#gpu#kimi#linearattention#memory#o1#qwen#triton

Комментарии (106)

Тред обсуждает сложность и интуитивность математической нотации в статье, а также доступность понимания машинного обучения и линейного внимания. Многие находят нотацию запутанной, но некоторые — полезной и ясной. Пользователи делятся трудностями в освоении темы, предлагают ресурсы и примеры, выражают благодарность за обмен опытом. Споры идут о степени сложности разработки линейного внимания и Kimi Delta Attention: одни считают их несложными, другие — требующими глубоких знаний. Некоторые сомневаются в их новизне, называя их комбинацией существующих идей. @dr_kretyn рекомендует bra-ket нотацию как более интуитивную, особенно для физиков.

Fp8 runs ~100 tflops faster when the kernel name has "cutlass" in it (github.com) 🔥 Горячее

В пул-реквесте к Triton представлена реализация механизма persistent attention для ускорения работы с большими контекстами в трансформерах. Вместо пересчета ключей и значений для каждого токена механизм сохраняет их в глобальной памяти, что значительно снижает вычислительную нагрузку при обработке длинных последовательностей.

Автор демонстрирует, как это позволяет эффективно работать с контекстами до 128K токенов, избегая квадратичной сложности традиционного внимания. Практический вывод: такой подход открывает путь к более масштабным моделям без пропорционального роста затрат на вычисления.

by mmastrac • 03 октября 2025 г. в 04:21 • 321 points

ОригиналHN

#amd#attention-mechanism#cutlass#github#gpu#intel#nvidia#transformers#triton

Комментарии (141)

  • NVIDIA использует хардкод для оптимизации кода, содержащего "cutlass" в названии, что может быть нестабильным и приводить к скрытым багам.
  • Подобные практики (оптимизации по именам функций или приложений) исторически распространены среди производителей железа и софта (ATI/AMD, Intel, Microsoft) для улучшения бенчмарков, иногда в ущерб качеству.
  • Мотивация таких оптимизаций часто не злонамеренна, а связана с снижением рисков и фокусом на стабильности собственных библиотек, но создаёт новые барьеры.
  • В индустрии существуют разногласия по поводу этичности таких практик, но для графических драйверов тюнинг под конкретные игры стал нормой.
  • Обсуждаются проблемы проприетарного кода (драйверы, прошивки) и затраты общества на обратную разработку вместо сотрудничества.