A. Smyntyna / Code
ENRU
Большое поле светящихся частиц протискивается через яркое горлышко и выходит плотным маленьким сгустком; одна яркая линия продолжается мимо него к правому краю.

Дистилляция: гонка за границей возможного

Как дистилляция позволяет маленьким моделям учиться у фронтирных систем, что теряется при доступе только через API и почему граница возможного не стоит на месте.

Перевод v1.0.1
AS

Alex Smyntyna

29 июля 2026 г. · 7 мин чтения

aitraining
01/Зачем локально

Две разные вещи под одним названием

Дистилляция — это обучение маленькой модели с помощью большой. Вот и вся идея, и под неё попадают две совершенно разные техники.

Разница — в доступе. Либо учитель это файл на вашем диске, который можно открыть, либо это API-эндпоинт, куда вы шлёте запросы. С файлом вы можете скопировать внутренности учителя. С эндпоинтом вам возвращают текст и больше ничего.

Дистилляция/Два уровня доступа

Обе схемы учат маленького ученика подражать большому учителю. Различается только насколько читаем учитель во время обучения.

01 / Белый ящик

Внутри лаборатории

У того, кто обучает, есть веса. Каждый шаг читает учителя изнутри, а функция потерь сравнивает два распределения напрямую.

УЧИТЕЛЬвеса на дискеУЧЕНИКповторяет функциюТЕКСТРАСПРЕДЕЛЕНИЕСКРЫТЫЕ СОСТОЯНИЯВНИМАНИЕГРАДИЕНТЫ

оплаченных запросов 0 файл и так открыт

02 / Чёрный ящик

Через API

Тот, кто обучает, шлёт промпты и получает текст. Сама модель остаётся за стеной, а ученик учится по расшифровкам.

УЧИТЕЛЬвеса скрытыУЧЕНИКповторяет текстТЕКСТРАСПРЕДЕЛЕНИЕтолько top-kСКРЫТЫЕ СОСТОЯНИЯВНИМАНИЕГРАДИЕНТЫAPIщельглазокздесь обрываются 3 канала

оплаченных запросов 1 247 по одному токену на каждый

Выберите каналперелистывание · нажмите любую плашку
Несёт
Токены, которые учитель действительно выдал, — одна последовательность из огромного числа возможных.
Через API
Единственный канал, переживающий передачу, и самый тонкий. Одна выборка заменяет собой целое распределение.
Внутри лаборатории
Что ученик видит на токен
Все 128 256 вероятностей, плюс скрытые состояния и внимание на каждом слое.
Что сравнивает функция потерь
Два распределения напрямую, токен за токеном. KL-дивергенция по мягким целям.
Недоступно
Ничего структурного. Только вычисления, данные и то, сколько вмещает ученик.
Через API
Что ученик видит на токен
Один сэмплированный токен. В лучшем случае несколько верхних лог-вероятностей, если поставщик их отдаёт.
Что сравнивает функция потерь
Догадку ученика с единственным токеном, который выдал учитель. Перекрёстная энтропия по расшифровке.
Недоступно
Распределение, скрытые состояния, внимание, градиенты — и всё, что учитель чуть было не сказал вместо этого.

Самый известный открытый пример второго рода — рассуждающая модель, с помощью которой сгенерировали около 800 000 примеров ответов, а потом на них дообучили несколько меньших открытых моделей. Ни обучения с подкреплением, ни весов. Только текст.

И то и другое называют дистилляцией. Почти каждая модель, достаточно маленькая, чтобы работать на вашей машине, — одно из двух.

02/Память

Что у модели есть до того, как она ответит

Модель никогда не выбирает слово. Она оценивает все слова, которые знает.

Словарь современной открытой модели — около 128 000 токенов. Каждый раз, когда она пишет одно слово, она выдаёт 128 000 чисел, по одному на каждый токен. Потом одно выбирается, а остальные выбрасываются.

Выброшенное и есть самое интересное.

Что на самом деле получает ученик

Тот же учитель, та же позиция токена. Меняется лишь одно: в ваших руках веса или ключ к API.

промпт

Комиссия часами разбирала противоречивые свидетельства, но в итоге сошлась на том, что предложение было { 128 256 вероятностей }

Переключитесь на «Только API», чтобы запустить эксперимент

Полное распределение здесь и так видно. Вкладка API показывает, насколько медленно его восстанавливает выборка текста.

распределение следующего токена
логарифмическая шкала · сетка кратна 10
  • обоснованным
    0.900
  • ущербным
    0.050
  • жизнеспособным
    0.020
  • неосуществимым
    0.010
  • многообещающим
    0.00600
  • неполным
    0.00400
  • рискованным
    0.00300
  • разумным
    0.00200
  • преждевременным
    0.00100
  • защитимым
    0.00080
  • неоднозначным
    0.00070
  • ошибочным
    0.00050
  • хвост
    ещё 128 244 токенов
    0.00200

Ученик видит весь этот вектор — для каждого токена каждого примера. Не ответ, а его форму: ущербным жив, жизнеспособным выигрывает у неосуществимым, ошибочным хуже всех остальных и всё равно остаётся ответом.

внутри: что идёт по проводу

128 256 вещественных чисел на каждый токен

Полный вещественный вектор по всему словарю. Порядок, разрывы и почти-победители — всё переживает передачу.

снаружи: что идёт по проводу

1 токен, не более 17.0 бит

Один выбор из 128 256 говорит, какой вариант победил, и ничего — насколько.

Вот что такое дистилляция, когда учитель ваш. Мягкая цель и есть обучающий сигнал, и он несёт гораздо больше, чем один правильный ответ из обычного датасета.

Допустим, наверху оказался sound с 0.90. flawed сидит на 0.05, а viable на 0.02. Этот разброс несёт суждение, которого нет в итоговом слове: учитель уверен, но всё же видит и критику, и правдоподобную альтернативу. Ничто из этого не доживает до текста.

Статья Хинтона 2015 года дала этому имя. Он назвал это тёмным знанием: то, что модель думает об ответах, которых не дала. Именно это вы копируете, если у вас есть файл, и именно это теряете, если файла нет.

03/Цена

Во сколько обходится угадывание

Очевидное возражение: можно ведь просто запросить много выборок и восстановить форму по ним. Это правда. Вот цена.

Чтобы выучить слово, встречающееся в 1% случаев, с точностью до 10%, нужно около 9 900 выборок. Чтобы выучить победителя с 90% — 12.

Эти два числа здесь потому, что разрыв между ними и есть вся проблема. Частое учится почти даром. Редкое стоит в восемьсот раз дороже, а редкое — это большая часть словаря.

А дальше идёт то, что закрывает спор. Настоящие обучающие данные видят каждое предложение один раз. Не 9 900 раз. Один. То есть форму вообще никто не измеряет: вы делаете одну выборку и идёте дальше.

Это всё равно работает, потому что миллионы разных предложений усредняют шум. Работает достаточно хорошо, чтобы большинство открытых моделей строили именно так. Но никто из тех, у кого есть веса, так не делает по своей воле.

04/Обвязка

А потом модели начали показывать ход мысли

За последнюю пару лет кое-что изменилось, и никто этого не планировал.

Рассуждающие модели выписывают свои шаги перед ответом. Какой подход выбрали, что выяснили на полпути, где ошиблись и вернулись назад. Всё это приходит текстом, через тот же самый API, который раньше отдавал голый ответ.

Вы получаете готовое исправление

Отдавать стейджинг по HTTPS. Ответ называет причину и способ починки, но ни одной из проверок, которые отличили его от неудачной догадки.

Обучающий сигнал1 ответ

Ученик узнаёт пункт назначения и вынужден восстанавливать расследование сам.

Передаёт
  • +Первопричину
  • +Итоговое исправление
Теряет
  • Цепочку улик
  • Все конкурирующие следующие шаги

ДоступЛюбой, у кого открыт продукт.

Названия действий делают распределения токенов читаемыми. Модель оценивает возможные следующие токены, а не аккуратные прямоугольники с названиями отладочных шагов.

Раньше дистилляция через API означала выучить пункт назначения. Теперь она означает выучить маршрут.

Одна лаборатория обучила небольшую рассуждающую модель на трассах модели конкурента и опубликовала, что эти трассы оказались примерно так же полезны, как у ведущей открытой альтернативы. Лаборатория, говорящая что-то лестное о продукте конкурента, — достаточная редкость, чтобы принять это всерьёз как измерение.

Но трасса — это один записанный путь. Подходы, которые учитель рассмотрел и отбросил, не оставляют после себя ничего. Это гораздо больше, чем был просто пункт назначения, и всё же это не форма.

05/Зачем локально

У кого есть файл

Два метода — не лучший и худший. Это два объёма доступа.

По меньшей мере одна крупная лаборатория описывала, как обучала выпускаемую модель от огромного внутреннего учителя, который никогда не выходил как продукт. Модель, построенная только для того, чтобы учить другие модели. Так поступают, когда файл у вас.

Всем остальным достаётся текст. Трассы рассуждений сделали этот текст куда ценнее, чем он был два года назад, и всё же это по-прежнему одна выборка на предложение.

06/Зачем локально

Гонка за границей возможного

Вот здесь техника перестаёт быть деталью обучения и становится аргументом.

Двигать границу вперёд чудовищно дорого. Копировать то, что граница говорит, — нет. Поэтому каждый раз, когда кто-то платит за сдвиг линии, всё, что ниже по течению, в тот же момент дешевеет. И приходит вторым.

Это та версия истории, которую обычно и рассказывают, и сама по себе она слишком проста. Никто, кто выпускает серьёзную модель, не дообучается просто на чужих ответах и не считает дело сделанным. Трассы идут вместе с корпусом, который лаборатория собирала годами, в веса собственной формы и размера, а следом пост-обучение, которого не запускал никто другой. Скопированное — это ингредиент. Иногда крупный. Никогда не весь рецепт.

большеменьшеграницапредел одних лишь трассученик
скопированосделано лабораторией100% этой модели — копия

собирается само · нажмите любой ингредиент

Дистиллированные трассы

Даёт: Большая фора. Ответы и цепочки рассуждений более сильной модели — самые дешёвые качественные данные, какие вообще бывали доступны.

Не может: Обогнать модель, из которой они взяты. Вы подгоняетесь под выходы чужой модели, поэтому её потолок — ваш потолок, а её ошибки лежат в вашей обучающей выборке.

Иллюстративные веса, а не измерения. График про состав, а не про оценки конкретной модели. Утверждение — в форме: трассы лишь один вход из нескольких, и потолок пробивается только тем ингредиентом, который невозможно скопировать.

Поэтому же «второй» — не навсегда. Граница возможного не одна лестница, на разных ступеньках которой все стоят.

Недавний флагман одной открытой лаборатории вышел с по-настоящему другой архитектурой. Переработанная схема внимания, память, отделённая от вычислений. Ещё там заменили стадию обучения с подкреплением дистилляцией от набора собственных узкоспециализированных учителей, и всё это опубликовали. Это дистилляция как внутренний инструмент, в лаборатории, которой принадлежат все задействованные файлы, обёрнутая в методы, которых до этого никто не выпускал.

Так что линия смещается вбок не реже, чем вверх. Лаборатория, отстававшая по старому рецепту, не обязательно отстаёт по новому, а модель, которую все копировали в прошлом году, перестаёт быть той, которую стоит копировать. Граница, определяемая тем, кто больше потратил, — куда менее устойчивая вещь, чем кажется.

Ничто из этого не устраняет спор. Позиция Anthropic — самая внятная из опубликованных, и она проводит черту в конкретном месте: дистилляция описана там как широко используемый и законный метод обучения, которым фронтирные лаборатории регулярно пользуются на собственных моделях, чтобы выпускать их меньшие и более дешёвые версии. Возражение не к технике. Оно к получению чужих возможностей через фиктивные аккаунты и обход условий использования, в промышленном масштабе, чтобы не платить по счёту.

В течение 2026 года несколько лабораторий публично выдвигали обвинения ровно такого рода: в корпоративных постах и в письмах законодателям, описывая кампании с десятками тысяч фальшивых аккаунтов и десятками миллионов выкачанных диалогов. Я не собираюсь здесь заново разбирать, кто что сделал. Это обвинения, большинство обвиняемых публично на них не ответили, и ничего из этого не рассмотрено по существу. Интересен механизм, и он тот же самый, о котором весь этот текст: кто-то ввёл очень много вопросов в чужую модель и обучился на ответах.

Часть, которая не разрешается

Оба утверждения верны одновременно. Дистилляция — это то, как отрасль делает модели достаточно маленькими, чтобы быть полезными, в том числе внутри каждой лаборатории, на собственных моделях, с собственными весами. Она же — способ срезать путь к возможностям, за поиск которых заплатил кто-то другой. Почти любое правило, которое можно написать против второго, попадает и в первое. Поэтому спор идёт о разрешении и масштабе, а не о самой технике.

07/Зачем локально

Что это значит, если вы просто запускаете модели

Почти у каждой модели, которую я гоняю локально, где-то в истории есть трассы от чего-то, что я не смог бы позволить себе запустить сам. Я выбрал их потому, что они быстрые и помещаются.

Это настоящий размен, и его стоит совершать с открытыми глазами. Это не плоское «вы запускаете ксерокопию», как принято думать. Хорошие локальные модели — те, где скопированное было полом, а не планом, где кто-то положил сверху свои данные, свою архитектуру и своё пост-обучение.

Это можно проверить до того, как качать 30 ГБ. Прочитайте, что лаборатория опубликовала о том, как модель делалась. Те, кто сделал работу, обычно о ней пишут.

Так что вопрос не в том, есть ли там дистилляция. Есть. Вопрос в том, что там есть кроме неё.