Running Gemma 4 26B at 5 tokens/sec on a 13-year-old Xeon with no GPU
На сервере в подвале, построенном из старого хранилища HP с двумя процессорами Xeon E5‑2690 v2 (Ivy Bridge, 2013) и без видеокарты, запущена открытая модель Gemma 4 26B‑A4B в квантовании Q8_0 и генерирует текст со скоростью около пяти токенов в секунду. Оборудование стоит менее трёхсот долларов, использует лишь AVX1, а не более новые AVX2/FMA3, и работает на DDR3‑памяти. Это удалось благодаря модификации проекта ik_llama.cpp, где убраны зависимости от AVX2 и добавлены fallback‑пути, позволяющие модели работать на пред‑AVX2 процессорах. Автор оригинального форка опирался на специфические оптимизации, но их пришлось обойти, перепаковав веса и отключив run‑time‑repack. Декодирование со скоростью около 5,2 токенов в секунду, оценка промпта — около 16 токенов в секунду. Чтобы запустить, собрать ik_llama.cpp без --run-time-repack и с отключённым GGML_USE_IQK_MULMAT, чтобы избежать зависимостей от AVX2. Это показывает, что даже железо, вышедшее из эксплуатации десяти лет назад, может стать сервером генерации, если правильно подобрать компиляцию и параметры.
Такая реализация подтверждает, что старый сервер может выполнять задачи современных моделей, если правильно адаптировать код, и подчёркивает ценность ручного анализа вместо покупки подписки, и показывает, насколько важен глубокий технический подход.