A. Smyntyna / Code
ENRU

мультимодальность

multimodal

Модель, принимающая на вход не только текст. На практике это означает изображения: скриншоты, фотографии, сканы PDF, закодированные в тот же поток токенов, что и промпт. Некоторые умеют ещё и звук. На выходе обычно всё равно текст.

Изображение превращается в несколько сотен или тысяч токенов, поэтому скриншот может съесть больше контекстного окна, чем вопрос про него.

Для локальной работы это разница между чат-игрушкой и чем-то полезным. Зрение — это то, что позволяет модели прочитать отсканированный документ, чек или сломавшийся интерфейс, который вы только что засняли, без отдельного OCR-конвейера перед ней.

Читать дальше