llama.cpp
Движок инференса на C++, на котором построено большинство инструментов для локального ИИ, включая Ollama и LM Studio. Он работает на CPU, CUDA, Metal и Vulkan — поэтому файлы GGUF, которые он читает, работают почти на любой машине. Рецепты квантования с именами вроде Q4_K_M и IQ3_XXS — его.
Напрямую его почти никто не запускает. Он важен тем, что задаёт словарь: когда в списке моделей вам предлагают шесть файлов с буквами после битности, эти буквы пришли из llama.cpp — и оттуда же причина, по которой один и тот же файл работает на Mac, на машине с Windows и на Raspberry Pi.