A. Smyntyna / Code
ENRU

Q4_K_M

Самый скачиваемый 4-битный рецепт llama.cpp и безопасный вариант по умолчанию. Q4 — четыре бита на вес, K — схема K-quant с поблочными множителями, M — средний размер внутри неё, где слои внимания и feed-forward, которые важнее прочих, поднимаются выше четырёх бит. Модель на 27B выходит около 16 ГБ.

Это не четыре бита. С учётом блочных множителей и повышенных слоёв файл Q4_K_M в среднем даёт 4,83 бита на вес, поэтому модель на 27B выходит в 16,3 ГБ там, где настоящие четыре бита дали бы 13,5. Эти 2,8 ГБ — то, что рецепт тратит, удерживая слои, которые плоское сжатие разнесло бы.

Буквы читаются слева направо как рецепт. Q8_0 — равномерные 8 бит без всякой послойной хитрости. Q4_K_S, Q4_K_M и Q4_K_L — малая, средняя и большая версии одной и той же 4-битной схемы, отличающиеся тем, сколько слоёв повышается. IQ3_XXS и его соседи используют матрицу важности, измеренную прогоном настоящего текста через модель, чтобы решить, какие веса можно позволить себе смять.

Если выбираете вслепую, берите сборку _K_M на той битности, которую позволяет ваша память. На ней сидят все остальные, а значит, её же и тестируют.

Читать дальше