MoE
Mixture of Experts, смесь экспертов. Модель разбита на множество маленьких подсетей (экспертов), и роутер выбирает для каждого токена лишь несколько из них. Модель на 35B с 3B активных на токен держит в памяти все 35B, но считает как модель на 3B, поэтому отвечает намного быстрее плотной модели того же общего размера.
Сделка — память в обмен на скорость: оперативка нужна под каждого эксперта, но скорость декодирования следует за активной долей, а не за полным числом параметров. Qwen3.6-35B-A3B держит в памяти 35B и активирует примерно 3B на токен.
Kimi K3 — та же идея в крайней точке: 896 экспертов, 16 из них работают на токен. 2,8 триллиона параметров хранится, 104 миллиарда из них читается ради одного слова.