Auto-research with codex: How I achieved a 232x Faster Kernel
Главная идея: автогенерация кода для QR‑разложения через блоковый алгоритм Хоусакера ускоряет вычисления в 232 раз по сравнению с базовым решением.
Ключевой факт: использование «кода‑максимизации» (Codex‑maxxing) позволило сгенерировать ядро, которое работает в FP16, но сохраняет FP32‑точность проверок.
Для ускорения важно разбивать матрицу на блоки, применять параллельный Householder‑алгоритм и постоянно генерировать новые варианты кода, отсекая те, что не дают прироста.
Оптимальная стратегия включает:
- небольшие предварительные ядра, которые быстро тестируются;
- итеративное улучшение через мутацию и отбор;
- внедрение идеи разнообразия (idea diversity) для выхода из локальных максимумов.
Эти приёмы сделали возможным достижение рекордного ускорения в конкурсе GPU‑режима.