GGUF
Однофайловый формат моделей, который использует llama.cpp и всё, что на нём построено, — Ollama, LM Studio. Один файл .gguf держит веса, квантование и метаданные, так что вы просто скачиваете и запускаете. Названия рецептов вроде Q4_K_M описывают, как внутри него квантовались слои.
GGUF — это JPEG среди файлов моделей: редко самый быстрый вариант на конкретной машине и открывается везде. Файл читается через memory-mapping, поэтому загрузка не означает, что сначала надо вычитать все 20 ГБ.
Если у вас Mac и существует сборка MLX — берите MLX. Иначе берите GGUF, а если у вас зоопарк машин — берите GGUF на всех, чтобы сравнивать один и тот же файл.