A. Smyntyna / Code
ENRU

рассуждающая модель

reasoning model

Модель, обученная выписывать свои выкладки прежде, чем ответить. Проход размышления — такой же порождённый текст, как любой другой, поэтому он стоит времени и токенов, и большинство интерфейсов его прячет. На замеренном прогоне на M4 Max модель 35B A3B дошла до первого токена за 2,66 секунды, а потом думала ещё 27.

Размышление — не отдельный режим, в который модель входит. Это передний срез фазы письма, порождаемый по одному токену с той же скоростью в токенах в секунду, что и ответ, и оплачиваемый по той же ставке.

Из-за чего ломается любая цифра времени, останавливающаяся на первом токене. TTFT останавливается именно там, а у рассуждающей модели этот токен — токен размышления, которого вам никто не показывает, так что заявленное ожидание может оказаться десятой долей того, которое вы высиживаете.

Это меняет и то, во что обходится длинный ответ. Модель, которая думает две минуты, и модель, которая две минуты читает ваш промпт, снаружи ощущаются одинаково, а чинятся противоположным: второй помогает меньше активных параметров, а первой помогает только более короткий бюджет размышления.

Читать дальше