MLX
Фреймворк Apple для работы с массивами, запускающий модели на Apple Silicon и заточенный под прямое использование GPU и единой памяти. Сборки MLX часто работают на Mac быстрее эквивалентного GGUF и выходят в собственном формате. Это нативная для Apple альтернатива стеку llama.cpp.
MLX — это фреймворк, а не формат-контейнер, и именно это различие делает выбор простым. Модель MLX — это веса плюс конфиг, разложенные так, как хочет фреймворк. Его ядра написаны под Metal, а поскольку единая память означает, что между CPU и GPU ничего не копируется, он пропускает накладные расходы, которые Metal-бэкенду llama.cpp приходится обходить.
Это преимущество своего поля, а не магия, и размер его меняется от модели к модели и от задачи к задаче.