
Дистилляция: гонка за границей возможного
Как дистилляция позволяет маленьким моделям учиться у фронтирных систем, что теряется при доступе только через API и почему граница возможного не стоит на месте.
Alex Smyntyna
29 июля 2026 г. · 7 мин чтения
Две разные вещи под одним названием
Дистилляция — это обучение маленькой модели с помощью большой. Вот и вся идея, и под неё попадают две совершенно разные техники.
Разница — в доступе. Либо учитель это файл на вашем диске, который можно открыть, либо это API-эндпоинт, куда вы шлёте запросы. С файлом вы можете скопировать внутренности учителя. С эндпоинтом вам возвращают текст и больше ничего.
Обе схемы учат маленького ученика подражать большому учителю. Различается только насколько читаем учитель во время обучения.
Внутри лаборатории
У того, кто обучает, есть веса. Каждый шаг читает учителя изнутри, а функция потерь сравнивает два распределения напрямую.
оплаченных запросов 0 — файл и так открыт
Через API
Тот, кто обучает, шлёт промпты и получает текст. Сама модель остаётся за стеной, а ученик учится по расшифровкам.
оплаченных запросов 1 247 — по одному токену на каждый
- Несёт
- Токены, которые учитель действительно выдал, — одна последовательность из огромного числа возможных.
- Через API
- Единственный канал, переживающий передачу, и самый тонкий. Одна выборка заменяет собой целое распределение.
- Что ученик видит на токен
- Все 128 256 вероятностей, плюс скрытые состояния и внимание на каждом слое.
- Что сравнивает функция потерь
- Два распределения напрямую, токен за токеном. KL-дивергенция по мягким целям.
- Недоступно
- Ничего структурного. Только вычисления, данные и то, сколько вмещает ученик.
- Что ученик видит на токен
- Один сэмплированный токен. В лучшем случае несколько верхних лог-вероятностей, если поставщик их отдаёт.
- Что сравнивает функция потерь
- Догадку ученика с единственным токеном, который выдал учитель. Перекрёстная энтропия по расшифровке.
- Недоступно
- Распределение, скрытые состояния, внимание, градиенты — и всё, что учитель чуть было не сказал вместо этого.
Самый известный открытый пример второго рода — рассуждающая модель, с помощью которой сгенерировали около 800 000 примеров ответов, а потом на них дообучили несколько меньших открытых моделей. Ни обучения с подкреплением, ни весов. Только текст.
И то и другое называют дистилляцией. Почти каждая модель, достаточно маленькая, чтобы работать на вашей машине, — одно из двух.
Что у модели есть до того, как она ответит
Модель никогда не выбирает слово. Она оценивает все слова, которые знает.
Словарь современной открытой модели — около 128 000 токенов. Каждый раз, когда она пишет одно слово, она выдаёт 128 000 чисел, по одному на каждый токен. Потом одно выбирается, а остальные выбрасываются.
Выброшенное и есть самое интересное.
Что на самом деле получает ученик
Тот же учитель, та же позиция токена. Меняется лишь одно: в ваших руках веса или ключ к API.
промпт
Комиссия часами разбирала противоречивые свидетельства, но в итоге сошлась на том, что предложение было { 128 256 вероятностей }
Переключитесь на «Только API», чтобы запустить эксперимент
Полное распределение здесь и так видно. Вкладка API показывает, насколько медленно его восстанавливает выборка текста.
- обоснованным0.900
- ущербным0.050
- жизнеспособным0.020
- неосуществимым0.010
- многообещающим0.00600
- неполным0.00400
- рискованным0.00300
- разумным0.00200
- преждевременным0.00100
- защитимым0.00080
- неоднозначным0.00070
- ошибочным0.00050
- хвостещё 128 244 токенов0.00200
Ученик видит весь этот вектор — для каждого токена каждого примера. Не ответ, а его форму: ущербным жив, жизнеспособным выигрывает у неосуществимым, ошибочным хуже всех остальных и всё равно остаётся ответом.
внутри: что идёт по проводу
128 256 вещественных чисел на каждый токен
Полный вещественный вектор по всему словарю. Порядок, разрывы и почти-победители — всё переживает передачу.
снаружи: что идёт по проводу
1 токен, не более 17.0 бит
Один выбор из 128 256 говорит, какой вариант победил, и ничего — насколько.
Вот что такое дистилляция, когда учитель ваш. Мягкая цель и есть обучающий сигнал, и он несёт гораздо больше, чем один правильный ответ из обычного датасета.
Допустим, наверху оказался sound с 0.90. flawed сидит на 0.05, а viable на 0.02. Этот разброс несёт суждение, которого нет в итоговом слове: учитель уверен, но всё же видит и критику, и правдоподобную альтернативу. Ничто из этого не доживает до текста.
Статья Хинтона 2015 года дала этому имя. Он назвал это тёмным знанием: то, что модель думает об ответах, которых не дала. Именно это вы копируете, если у вас есть файл, и именно это теряете, если файла нет.
Во сколько обходится угадывание
Очевидное возражение: можно ведь просто запросить много выборок и восстановить форму по ним. Это правда. Вот цена.
Чтобы выучить слово, встречающееся в 1% случаев, с точностью до 10%, нужно около 9 900 выборок. Чтобы выучить победителя с 90% — 12.
Эти два числа здесь потому, что разрыв между ними и есть вся проблема. Частое учится почти даром. Редкое стоит в восемьсот раз дороже, а редкое — это большая часть словаря.
А дальше идёт то, что закрывает спор. Настоящие обучающие данные видят каждое предложение один раз. Не 9 900 раз. Один. То есть форму вообще никто не измеряет: вы делаете одну выборку и идёте дальше.
Это всё равно работает, потому что миллионы разных предложений усредняют шум. Работает достаточно хорошо, чтобы большинство открытых моделей строили именно так. Но никто из тех, у кого есть веса, так не делает по своей воле.
А потом модели начали показывать ход мысли
За последнюю пару лет кое-что изменилось, и никто этого не планировал.
Рассуждающие модели выписывают свои шаги перед ответом. Какой подход выбрали, что выяснили на полпути, где ошиблись и вернулись назад. Всё это приходит текстом, через тот же самый API, который раньше отдавал голый ответ.
На стейджинге пользователей выкидывает после первой же страницы. Почему?
Отдавать стейджинг по HTTPS, чтобы Secure-cookie сессии сохранялась.
Вы получаете готовое исправление
Отдавать стейджинг по HTTPS. Ответ называет причину и способ починки, но ни одной из проверок, которые отличили его от неудачной догадки.
Ученик узнаёт пункт назначения и вынужден восстанавливать расследование сам.
- +Первопричину
- +Итоговое исправление
- −Цепочку улик
- −Все конкурирующие следующие шаги
ДоступЛюбой, у кого открыт продукт.
Раньше дистилляция через API означала выучить пункт назначения. Теперь она означает выучить маршрут.
Одна лаборатория обучила небольшую рассуждающую модель на трассах модели конкурента и опубликовала, что эти трассы оказались примерно так же полезны, как у ведущей открытой альтернативы. Лаборатория, говорящая что-то лестное о продукте конкурента, — достаточная редкость, чтобы принять это всерьёз как измерение.
Но трасса — это один записанный путь. Подходы, которые учитель рассмотрел и отбросил, не оставляют после себя ничего. Это гораздо больше, чем был просто пункт назначения, и всё же это не форма.
У кого есть файл
Два метода — не лучший и худший. Это два объёма доступа.
По меньшей мере одна крупная лаборатория описывала, как обучала выпускаемую модель от огромного внутреннего учителя, который никогда не выходил как продукт. Модель, построенная только для того, чтобы учить другие модели. Так поступают, когда файл у вас.
Всем остальным достаётся текст. Трассы рассуждений сделали этот текст куда ценнее, чем он был два года назад, и всё же это по-прежнему одна выборка на предложение.
Гонка за границей возможного
Вот здесь техника перестаёт быть деталью обучения и становится аргументом.
Двигать границу вперёд чудовищно дорого. Копировать то, что граница говорит, — нет. Поэтому каждый раз, когда кто-то платит за сдвиг линии, всё, что ниже по течению, в тот же момент дешевеет. И приходит вторым.
Это та версия истории, которую обычно и рассказывают, и сама по себе она слишком проста. Никто, кто выпускает серьёзную модель, не дообучается просто на чужих ответах и не считает дело сделанным. Трассы идут вместе с корпусом, который лаборатория собирала годами, в веса собственной формы и размера, а следом пост-обучение, которого не запускал никто другой. Скопированное — это ингредиент. Иногда крупный. Никогда не весь рецепт.
собирается само · нажмите любой ингредиент
Дистиллированные трассы
Даёт: Большая фора. Ответы и цепочки рассуждений более сильной модели — самые дешёвые качественные данные, какие вообще бывали доступны.
Не может: Обогнать модель, из которой они взяты. Вы подгоняетесь под выходы чужой модели, поэтому её потолок — ваш потолок, а её ошибки лежат в вашей обучающей выборке.
Поэтому же «второй» — не навсегда. Граница возможного не одна лестница, на разных ступеньках которой все стоят.
Недавний флагман одной открытой лаборатории вышел с по-настоящему другой архитектурой. Переработанная схема внимания, память, отделённая от вычислений. Ещё там заменили стадию обучения с подкреплением дистилляцией от набора собственных узкоспециализированных учителей, и всё это опубликовали. Это дистилляция как внутренний инструмент, в лаборатории, которой принадлежат все задействованные файлы, обёрнутая в методы, которых до этого никто не выпускал.
Так что линия смещается вбок не реже, чем вверх. Лаборатория, отстававшая по старому рецепту, не обязательно отстаёт по новому, а модель, которую все копировали в прошлом году, перестаёт быть той, которую стоит копировать. Граница, определяемая тем, кто больше потратил, — куда менее устойчивая вещь, чем кажется.
Ничто из этого не устраняет спор. Позиция Anthropic — самая внятная из опубликованных, и она проводит черту в конкретном месте: дистилляция описана там как широко используемый и законный метод обучения, которым фронтирные лаборатории регулярно пользуются на собственных моделях, чтобы выпускать их меньшие и более дешёвые версии. Возражение не к технике. Оно к получению чужих возможностей через фиктивные аккаунты и обход условий использования, в промышленном масштабе, чтобы не платить по счёту.
В течение 2026 года несколько лабораторий публично выдвигали обвинения ровно такого рода: в корпоративных постах и в письмах законодателям, описывая кампании с десятками тысяч фальшивых аккаунтов и десятками миллионов выкачанных диалогов. Я не собираюсь здесь заново разбирать, кто что сделал. Это обвинения, большинство обвиняемых публично на них не ответили, и ничего из этого не рассмотрено по существу. Интересен механизм, и он тот же самый, о котором весь этот текст: кто-то ввёл очень много вопросов в чужую модель и обучился на ответах.
Часть, которая не разрешается
Оба утверждения верны одновременно. Дистилляция — это то, как отрасль делает модели достаточно маленькими, чтобы быть полезными, в том числе внутри каждой лаборатории, на собственных моделях, с собственными весами. Она же — способ срезать путь к возможностям, за поиск которых заплатил кто-то другой. Почти любое правило, которое можно написать против второго, попадает и в первое. Поэтому спор идёт о разрешении и масштабе, а не о самой технике.
Что это значит, если вы просто запускаете модели
Почти у каждой модели, которую я гоняю локально, где-то в истории есть трассы от чего-то, что я не смог бы позволить себе запустить сам. Я выбрал их потому, что они быстрые и помещаются.
Это настоящий размен, и его стоит совершать с открытыми глазами. Это не плоское «вы запускаете ксерокопию», как принято думать. Хорошие локальные модели — те, где скопированное было полом, а не планом, где кто-то положил сверху свои данные, свою архитектуру и своё пост-обучение.
Это можно проверить до того, как качать 30 ГБ. Прочитайте, что лаборатория опубликовала о том, как модель делалась. Те, кто сделал работу, обычно о ней пишут.
Так что вопрос не в том, есть ли там дистилляция. Есть. Вопрос в том, что там есть кроме неё.