Ollama
Локальный раннер моделей, построенный на llama.cpp и управляемый из терминала. `ollama run gemma4` скачивает веса и запускает чат. Он ещё и отдаёт OpenAI-совместимый API на порту 11434 — благодаря чему другие программы на вашей машине говорят с моделью, ничего не зная о том, как она загружена.
Вклад Ollama был в том, что скачивание и запуск стали одной командой. Она сама выбирает квантование, держит модели в одном месте и выгружает их, когда те простаивают.
Плата по сравнению с раннером с интерфейсом — контроль. Ручек меньше, а подобранные ей значения по умолчанию консервативны: обычно это правильно, но иногда означает, что вы крутите квантование мельче, чем ваша машина способна удержать.