A. Smyntyna / Code
ENRU

префилл

prefill

Фаза чтения. Прежде чем что-то написать, модель прогоняет через себя весь ваш промпт, каждый его токен, заполняя KV-кеш. Отсюда и берётся ожидание перед первым словом, и упирается оно в вычисления: плотная модель на 27B делает 27 миллиардов параметров арифметики на каждый присланный вами токен, A3B — 3 миллиарда.

Префилл прогоняет все токены промпта разом, а не по очереди, — поэтому его ограничивает то, сколько арифметики способен сделать чип, а не то, как быстро он читает память. Декодирование противоположно по обоим пунктам.

Практическое следствие: стоимость префилла растёт вместе с промптом, и больше ничто в конвейере так себя не ведёт. Удвоить промпт — примерно удвоить ожидание. Удвоить активные параметры модели — то же самое. Агентский харнесс заново шлёт весь свой разговор на каждом шаге, поэтому платит этот счёт снова на каждом вызове инструмента, — из-за чего одна и та же модель ощущается мгновенной в окне чата и невыносимой внутри агента.

Одна особенность, которую стоит знать: пропускная способность префилла на длинных промптах обычно растёт, потому что работы для батча больше и чип перестаёт простаивать. Суммарное ожидание всё равно ползёт вверх, просто не так быстро, как число токенов.

Читать дальше