Why your local LLM feels dumber than it is
Локальный LLM часто кажется «глупым», хотя модель теоретически способна на большее. Причина — различия в реализации вывода: каждый набор железа и программного обеспечения (GPU‑архитектура, драйверы, библиотеки) вычисляет логиты по‑своему, а небольшие отклонения в вероятностях следующего токена приводят к заметно другим результатам.
Ключевой эксперимент сравнил пять вариантов квантования (W8A16, FP8, INT8, AWQ W4A16, NVFP4) на одинаковом наборе весов. Самый «умный» вариант — W8A16 — показал наименьшее количество переключений токенов (≈ 5 % при 88 k контекста), тогда как NVFP4 отставал с ~50 % ошибок. Кроме того, только FP8 и INT8 корректно выполнили цепочку команд Cisco, остальные сгенерировали «show run» вместо правильного «show arp». Эти данные подтверждают, что даже при одинаковых весах результат сильно зависит от выбранного бэкенда и настроек декодера.
Запомните: небольшие изменения в logits → кардинальные различия в поведении; правильный sampler (temp ≈ 1.0, top‑p ≈ 0.95) и совместимый attention‑kernel (например, Triton ATTN) могут вернуть до 50 % точности, а неправильный набор параметров делает модель «глухой».