инференс
inference
Запуск обученной модели ради вывода, в отличие от её обучения. Когда вы пишете промпт и модель порождает ответ — это инференс. Он делится на две фазы: чтение вашего промпта (префилл) и написание ответа по одному токену (декодирование).