A. Smyntyna / Code
ENRU

chat completion

Самый простой способ использовать модель: вы отправляете список сообщений, она отправляет один ответ, и больше ничего не происходит. Ни инструментов, ни файлов, ни второго хода по её собственному решению. Это один HTTP-запрос куда-нибудь на http://127.0.0.1:1234/v1/chat/completions, и любой агент или харнесс, который вам встретится, — это программа, делающая этот же вызов в цикле.

Один такой запрос — это и есть всё «использование локальной модели». LM Studio или Ollama загружает веса и слушает порт, вы шлёте сообщения, получаете текст.

Разница между этим и агентом — не в модели. Она в том, что кто-то написал программу, которая читает ответ, замечает в нём просьбу выполнить команду, выполняет её и отправляет всё целиком обратно следующим сообщением. Тот же эндпоинт, вызванный двадцать раз вместо одного.

Читать дальше