тензорный параллелизм
tensor parallelism
Разрезание каждого отдельного слоя между машинами, так что над каждым токеном работает каждая машина и их пропускные способности памяти складываются. Это тот способ разрезания, который делает кластер быстрее, а не только больше. exo сообщает о 1,8× на двух устройствах и 3,2× на четырёх — почти линейно, но не совсем.
Разрыв между четырьмя машинами и 3,2× — это интерконнект. На каждом слое машинам приходится обмениваться частичными результатами, поэтому сеть сидит внутри внутреннего цикла, а не по краям от него. Оттого быстрый путь exo — это RDMA поверх Thunderbolt 5, и оттого он хочет, чтобы каждая машина была соединена кабелем с каждой, а не в гирлянду.
У конвейерного параллелизма профиль противоположный: почти никакого обмена и никакого ускорения тоже.