Hacker News Digest

04 августа 2026 г. в 10:00 • github.com • ⭐ 347 • 💬 87

OriginalHN

#amd#deepseek#fp8#gpu#hbm3#llm#mi300x#moe#rocm#token-throughput

DeepSeek V4 Flash on a Single AMD MI300X

Главная идея — первый рабочий запуск DeepSeek‑V4‑Flash‑0731 на одной видеокарте AMD MI300X без дополнительной квантовки или оффлоу. Модель полностью помещается в 156,7 GiB HBM3, а благодаря 192 GiB памяти и 5,3 TB/s пропускной способности достигается пропускная способность до ≈ 8 K токенов/сек при предзаполнении и 168,6 токенов/сек в медиане однопоточного декодирования. При 8‑х одновременных потоках суммарный вывод достигает 542 токенов/сек, а пиковый 64‑потоковый баст‑запрос укладывается в 830 токенов/сек без OOM и ошибок движка. Контекст поддерживается до 256 K токенов (архитектура теоретически позволяет 1 M).

Ключевые факты, которые стоит запомнить:

  • 156,7 GiB весов — полностью в HBM, без offload‑квантовки;
  • ≈ 8 K tok/s предзаполнение (6 988–7 019 tok/s в продакшн‑профиле);
  • 542 tok/s суммарный вывод при 8‑х потоках, 830 tok/s при 64‑потоковом басте;
  • Исправления касаются FP8‑формата MI300X, MoE‑маршрутизации, CPU‑KV синхронизации и специфичных ядер ROCm.

Эти детали позволяют использовать MI300X как дешевый (в 2–3 раза) альтернативный вариант к NVIDIA‑решениям для тяжёлых LLM‑задач.