MXFP4
4-битный формат с плавающей точкой, в котором один масштабный множитель делится на небольшой блок весов, — так сохраняется больше динамического диапазона, чем у простых 4-битных целых. В нём выходят GPT-OSS-120B и Kimi K3. Раскладка с плавающей точкой означает, что 16 доступных значений расставлены полезнее, чем равномерно отстоящие целые.
MXFP4 принадлежит к семейству числовых форматов, рядом с BF16 и FP16, а не к семейству файловых форматов с GGUF и MLX. Файл GGUF может держать веса MXFP4; эти двое отвечают на разные вопросы.
Собственного имени он заслуживает тем, что новые GPU считают его нативно, а не разворачивают сначала во что-то более широкое, и тем, что он встречается в весах как они выпущены, а не только в сжатиях от сообщества.
Kimi K3 — самый ясный случай второго. Moonshot обучала её quantization-aware в MXFP4 через всю стадию пост-тренинга, и на supervised fine-tuning, и на обучении с подкреплением, — так что модель приспосабливалась к 4-битной арифметике по ходу обучения, а не была втиснута в неё после. В MXFP4 только веса экспертов. Активации идут в MXFP8, а неэкспертные слои остаются шире. На выходе получается 1,56 ТБ там, где та же модель в BF16 весила бы около 5,6 ТБ.