A. Smyntyna / Code
ENRU

распределённый инференс

distributed inference

Запуск одной модели на нескольких машинах, потому что ни на одну из них она не влезает. Память складывается, и модель загружается. Скорость обычно не складывается: exo сообщает о 1,8× на двух устройствах и 3,2× на четырёх, когда ему удаётся расшардить слои, и ни о чём вообще, когда он может только сцепить их в цепочку.

Инструмент, за которым тянутся первым делом, — exo. Он сам находит остальные машины, сам решает, как разрезать модель по тому, что увидел, и отдаёт OpenAI-совместимый эндпоинт — так что всё, что уже нацелено на локальную модель, работает с кластером без единого изменения.

Цена — в физическом слое. Быстрый путь exo — это RDMA поверх Thunderbolt 5, а ему нужны macOS 26.2 или новее, каждая машина, соединённая кабелем с каждой, и совпадающие версии ОС вплоть до номера беты. Сборка под Linux работает только на CPU, так что стопка карт NVIDIA — не то, что он сегодня кластеризует.

О чём стоит договориться с собой до того, как тратить деньги: складывая память, вы покупаете возможность загрузить модель. Будет ли она при этом работать с полезной скоростью, зависит целиком от того, какой из двух способов разрезания ей достанется.

Читать дальше

Снаружи