TTFT
Time To First Token, время до первого токена: сколько вы ждёте после нажатия Enter, прежде чем модель выдаст хоть что-нибудь. В основном это префилл, чтение моделью всего вашего промпта, — поэтому длинный промпт или документ делает ожидание хуже. На плотной модели в 27B большой промпт может означать минуту-две ожидания, прежде чем что-то появится.
TTFT и токены в секунду измеряют две половины запроса и могут расходиться полностью. На замеренном прогоне на M4 Max с одним и тем же промптом в 4000 токенов плотная модель на 27B ждала 16 секунд, прежде чем что-то написать, а 35B A3B — 2,66. Плотная модель пускает в работу вдевятеро больше параметров на каждый токен промпта, и ожидание следует за этим почти напрямую.
Какое из чисел важнее, зависит от формы вашей работы, а не от модели. Короткий вопрос, длинный ответ: ожидание — ничто, решают токены в секунду. Длинный документ, короткий ответ: ожидание — почти всё. Агентский харнесс сидит на дальнем конце этого диапазона, потому что заново отправляет весь разговор на каждом шаге и платит полную стоимость чтения перед каждым вызовом инструмента.
На рассуждающей модели эти двое часов расходятся. Любой инструмент, сообщающий TTFT, останавливает счётчик на первом порождённом моделью токене, а этот токен — токен размышления, который интерфейс может от вас скрыть. Ожидание, которое вы переживаете на самом деле, — это TTFT плюс весь проход размышления. На том же прогоне на M4 Max за 2,66 секунды A3B последовало 27 секунд размышления, прежде чем начался ответ, а за 7,6 секунды у 122B — 35. Размышление — не приваренное сверху время; это передний срез фазы письма. Но это всё равно время, проведённое в разглядывании пустоты.
Единственное, что надёжно это улучшает, — меньше активных параметров, и в этом весь аргумент за mixture of experts. Купить больше пропускной способности памяти здесь не поможет, потому что префилл памяти не ждёт.