A. Smyntyna / Code
ENRU

смешанная точность

mixed precision

Квантование разных частей модели в разную битность вместо того, чтобы сминать всё одинаково. Типичный рецепт держит примерно 15% несущих весов на 8 битах, а остальные 85% опускает до 4 — это стоит чуть дороже равномерных 4 бит и сохраняет большую часть того, что равномерные 4 бита выбрасывают.

Не все веса одинаково важны. Одни повредишь — модель почти не заметит; другие — и она перестаёт удерживать мысль. Равномерное сжатие их различать не умеет и поэтому платит одну и ту же цену везде.

Фотография на странице про квантование показывает ту же мысль. Включите смешанную точность — и солнце с гребнем останутся на 8 битах, пока небо опускается до того, что стоит на ползунке. Почти при том же размере файла бэндинг оказывается там, куда никто не смотрел.

Фронтирная версия этого асимметрична: DwarfStar 4 сжимает до 2 бит только маршрутизируемых экспертов DeepSeek V4 Flash, а внимание и общие компоненты оставляет высокими, — благодаря чему модель на 284B работает на Mac со 128 ГБ.

Читать дальше