токенов в секунду
tokens per second
Насколько быстро модель пишет, и то самое число, с которого начинается любой бенчмарк. Прикинуть его можно как пропускную способность памяти, делённую на байты активных параметров: 3 миллиарда активных на 8 битах — это 3 ГБ на токен, так что M4 Max с 546 ГБ/с упирается где-то в 180. Реальные замеры выходят вполовину или на три четверти от этого.
Примерно 7 токенов в секунду — темп чтения человека. Всё выше примерно 20 ощущается в окне чата мгновенным. Ниже 10 вы смотрите, как она печатает.
Число описывает только декодирование, поэтому об ожидании перед первым словом оно не говорит ничего. Для короткого вопроса это почти вся история. Для длинного промпта это меньшая часть общего времени, а для агента, заново отправляющего 60 000 токенов контекста на каждом ходу, оно почти нерелевантно. Две модели могут различаться в 5 раз по токенам в секунду и в 6 раз в обратную сторону по тому, сколько вы просидите.
И оно не переносится между сборками. Квантование, длина контекста, рантайм, прогрет ли был кеш, троттлинг ноутбука под долгой нагрузкой — всё это его двигает. Цифра tok/sec чего-то стоит, когда обе стороны сравнения гонялись на одной и той же машине, и стоит очень мало во всех остальных случаях.