A. Smyntyna / Code
ENRU

конвейерный параллелизм

pipeline parallelism

Разрезание модели по слоям между машинами: первая машина держит слои с 1-го по 20-й, следующая — с 21-го по 40-й, и токен идёт по цепочке. Это то, что позволяет негабаритной модели влезть, и это не ускоряет ничего, потому что в каждый момент считает только одна машина.

Четыре машины, каждая читающая четверть весов одна за другой, читают ровно столько же байт, сколько одна машина, читающая все. Пропускная способность не складывается. Куплена была вместимость.

Это честный ответ на вопрос «ускорит ли кластер». Сам по себе нет. Скорость возвращает тензорный параллелизм, и ему нужен интерконнект, достаточно быстрый, чтобы гонять активации между всеми машинами на каждом слое.

Читать дальше