A. Smyntyna / Code
ENRU

multi-token prediction

Спекулятивное декодирование со встроенной черновой моделью. Модель обучена с дополнительной головой, предсказывающей токен через один, поэтому она сама предлагает продолжения и сама же проверяет их за один проход — без второй модели, которую надо грузить и держать в памяти. Популяризовал приём DeepSeek V3.

Механизм тот же, что у спекулятивного декодирования, и гарантия та же: вывод совпадает с тем, что модель выдала бы токен за токеном. Разница в том, откуда берётся догадка. Дополнительная предсказательная голова, обученная рядом с основной, пишет черновик бесплатно — и это убирает две неудобные части классической схемы: поиск маленькой модели с тем же токенизатором и плату памятью за неё.

DeepSeek сообщал о примерно 80–90% принятых вторых токенов и ускорении генерации около 1,8×. Это число одной модели, и оно не обобщается. Реализации сильно расходятся в том, сколько они на деле дают, а некоторые выпускают приём с жёсткой проверкой корректности и почти никакого выигрыша не показывают.

Отчасти из-за этого модель может ощущаться быстрее, чем предполагают её число параметров и её же цифра токенов в секунду.

Читать дальше