A. Smyntyna / Code
ENRU

llama.cpp

Движок инференса на C++, на котором построено большинство инструментов для локального ИИ, включая Ollama и LM Studio. Он работает на CPU, CUDA, Metal и Vulkan — поэтому файлы GGUF, которые он читает, работают почти на любой машине. Рецепты квантования с именами вроде Q4_K_M и IQ3_XXS — его.

Напрямую его почти никто не запускает. Он важен тем, что задаёт словарь: когда в списке моделей вам предлагают шесть файлов с буквами после битности, эти буквы пришли из llama.cpp — и оттуда же причина, по которой один и тот же файл работает на Mac, на машине с Windows и на Raspberry Pi.

Читать дальше

Снаружи