A walk through of the DeltaNet family of linear attention variants
В статье показано, как простые предположения о скрытом состоянии приводят к формуле линейного внимания, известной как Kimi Delta Attention (KDA), которая вытекает из семейства DeltaNet и используется в моделях Qwen и Kimi. Ключевой приём — заменить softmax на умножение на деградирующие матрицы и добавить корректирующий вектор ошибки, что позволяет обновлять состояние рекуррентно и хранить лишь текущий стейт. При этом запросы масштабируются по (d_k^{-1/2}), а ключи нормализованы, чтобы их внутреннее произведение оставалось в пределах одного скаляра. Такой подход превращает квадратичную зависимость от длины последовательности в линейную, а также делает возможным кэширование ключей и значений без роста памяти.
В результате получаем O(1) память и возможность обрабатывать запросы за константное время, а также β‑параметр, задающий экспоненциальный спад, который делает внимание устойчивым к очень длинным контекстам. Реализация KDA в Triton использует кусочные схемы: внутри чанка вычисляются диагональные взаимодействия, а между ними решается триангулярная система, что позволяет параллелить расчёты на GPU. Такой подход лежит в основе эффективного прямого прохода, используемого в последних версиях Qwen и Kimi, и демонстрирует, как простая идея о скрытом состоянии может породить мощный линейный механизм внимания.