Hacker News Digest

09 июля 2026 г. в 08:05 • github.com • ⭐ 809 • 💬 200

OriginalHN

#github

Show HN: Getting GLM 5.2 running on my slow computer

Создан полностью на С движок, позволяющий запускать модель GLM‑5.2 с 744 млрд параметров в режиме Mixture‑of‑Experts на обычном ПК, у которого есть лишь 25 ГБ оперативной памяти. Реализация не использует сторонних библиотек, а вместо этого стримит нужные «эксперты» с диска, загружая в RAM только те части модели, которые сейчас вычисляются. Это делает возможным работу гигантской модели, обычно требующей кластеров, на обычном настольном компьютере.

Ключевой приём — стриминг экспертов, позволяющий модели с 744 B параметров «выходить» за пределы 25 GB RAM, поскольку в любой момент в памяти находятся лишь несколько активных экспертов. Такой подход сохраняет высокую пропускную способность и низкую задержку, а чистый C‑код гарантирует отсутствие зависимостей и простоту развертывания. Это демонстрирует, что даже модели, размер которых в несколько раз превышает доступную память, могут работать на обычных машинах, открывая путь к более децентрализованному использованию крупномасштабных ИИ‑систем. 🐦 Модель GLM‑5.2 содержит почти три раза больше параметров, чем GPT‑4, а её архитектура Mixture‑of‑Experts делит вычисления между сотнями специализированных подмоделей. Благодаря стримингу с диска, нагрузка на оперативную память остаётся минимальной, что позволяет поддерживать интерактивные ответы даже при генерации длинных текстов.