Assembly Hall of Shame
Главная идея — поиск самого медленного одиночного процессорного инструкта, а не ускорения кода. Чем дольше один вызов, тем ниже «потолок» производительности, который можно достичь.
В x86‑версии рекорд держит fxrstor64, который за ≈ 62 секунды (≈ 198 млрд циклов) загружает 512‑байтовый FPU‑/MMX‑/XMM‑контекст из медленной MMIO‑зоны, пока остальные ядра «бьют» соседний регистр 4‑байтовыми чтениями, полностью загружая PCIe‑шину. На AMD Ryzen 7 5800H эта техника дала ≈ 74,5 млрд циклов, а в теоретическом варианте с xrstor64 (8 КБ‑состояние) потенциально ≈ 10¹² циклов.
Кратко: использование специфичных инструкций ввода‑вывода и насыщение шины прерываниями превращает обычный загрузчик состояния в рекордный «замедлитель».