Mesh LLM: distributed AI computing on iroh
Mesh LLM позволяет запускать большие модели, используя имеющиеся GPU, и предоставлять их в виде единого OpenAI‑совместимого API. Вы можете начать с одного узла, добавить новые позже и система автоматически выбирает, где выполнять запрос — локально, на соседнем пире или в нескольких стадиях пайплайна. Такая сеть iroh‑конечных точек объединяет вычислительные ресурсы без покупки дорогостоящих облачных GPU и дает контроль над обновлениями модели, хранением данных и железом.
Внутри каждый узел получает уникальный публичный ключ и открывает QUIC‑соединение, а iroh обеспечивает пробой NAT и реляй‑переходы через два глобальных релея. На канале передаются байтовые метки: 0x01 — рассылка возможностей, 0x04 — туннель HTTP, 0x05 — запрос маршрутизации и др., что позволяет передавать активации между стадиями модели. Пакет поддерживает более 40 моделей, от полумиллиардных, укладывающихся в ноутбук, до гигантских 235‑млрд‑параметрных экспертов, а также реализует режим «Skippy», разбивая слой‑по‑слою диапазоны (0‑15 на одном узле, 16‑31 на другом), так что даже набор modest machines может совместно запустить модель, которую никто из них не смог бы загрузить один. Клиент OpenAI видит лишь localhost:9337/v1, не подозревая, что запросы проходят пайплайны.