A. Smyntyna / Code
ENRU

Ollama

Локальный раннер моделей, построенный на llama.cpp и управляемый из терминала. `ollama run gemma4` скачивает веса и запускает чат. Он ещё и отдаёт OpenAI-совместимый API на порту 11434 — благодаря чему другие программы на вашей машине говорят с моделью, ничего не зная о том, как она загружена.

Вклад Ollama был в том, что скачивание и запуск стали одной командой. Она сама выбирает квантование, держит модели в одном месте и выгружает их, когда те простаивают.

Плата по сравнению с раннером с интерфейсом — контроль. Ручек меньше, а подобранные ей значения по умолчанию консервативны: обычно это правильно, но иногда означает, что вы крутите квантование мельче, чем ваша машина способна удержать.

Читать дальше