EnglishРусский Map
Open-Source AI & Open Models Reading List

Как сегодня применяется дистилляция и какой прирост производительности она даёт открытым моделям

title
Как сегодня применяется дистилляция и какой прирост производительности она даёт открытым моделям
type
summary
summary
Заметка Ламберта (июль 2026 года): дистилляция даёт старт SFT для китайских лабораторий, но теряет вес с ростом роли RL. Ответ на тезис Stratechery
tags
ai, llm, distillation, post-training, reinforcement-learning, open-weights
created
2026-09-14
updated
2026-09-14
lang
ru
source_updated
2026-09-14
translated
2026-09-14
translator
lllm/antigravity/gemini-3.7-flash-medium

Этот короткий пост за июль 2026 года вышел в личном Substack'е Нейтана Ламберта, а не в interconnects. Он читается как рабочие заметки: цитата из твита и список его тезисов. Сохранённая копия объёмом около 750 слов заканчивается списком литературы и блоком комментариев Substack'а, так что это полный текст, а не обрезанный фрагмент. Шероховатые формулировки ("Then... where I stand", "Getting to the end of it") сохранены как в оригинале.

Повод

Бен Томпсон написал в Stratechery, что китайские лаборатории применяют дистилляцию на этапе RL и что это всё сильнее влияет на производительность моделей. Ламберт возразил в X: китайские лаборатории не используют Fable, сильнейшую модель, как учителя во время RL. "Дистилляция так не работает". Оценщики (graders) в RL нестабильны, поэтому прирост был бы скромным, к тому же никто не может позволить себе гонять Fable в таких объёмах. (Сентябрьский отчёт Anthropic, anthropic-threat-report-september-2026, называет Fable своей топовой общедоступной моделью.)

Где дистилляция применяется на самом деле

Anthropic заявляла, что DeepSeek и другие компании использовали её модели в конвейере данных формата RL. По мнению Ламберта, это были небольшие выборки, скорее всего для инициализации внутренней модели или экспериментов, и формулировка "в формате RL" вовсе не означает сильного эффекта.

Этап, где дистилляция действительно важна, - это SFT и midtraining, которые он объединяет в одну стадию зарождения рассуждений (reasoning). Обучение предсказанию следующего токена прививает модели повторяющиеся кластеры токенов, поэтому некоторые китайские модели и называют себя Claude. Данные для этого этапа получают в обход штатного поведения API, чтобы извлечь токены рассуждений. Без сырого хода мыслей обучать модель на таких данных было бы намного сложнее, и привычка говорить "я Claude", вероятно, тоже не появилась бы.

SFT-датасет для reasoning содержит порядка миллиона промптов с качественными ответами. Сложнее всего обычно подготовить сами промпты, особенно те, под которые есть окружения для последующего RL. Дистиллированный SFT полезнее всего, когда модель заходит в домен, где американские лаборатории ушли далеко вперёд. Его пример - физика в бенчмарке CritPT (в посте написано "CripPT", ссылка ведёт на CritPT): собираются промпты, берутся ответы передовой модели и запускается начальный SFT.

Почему прирост сокращается

Начальный SFT-набор - это лишь старт долгого пути. Чтобы выйти на уровень GLM-5.2 (glm-5-2-step-change-for-open-agents) или Kimi K3 (kimi-k3), всё равно требуется дальнейшая генерация SFT-данных, фильтрация, механизмы вроде rejection sampling и огромный объём RL. Судя по одним только срокам, Ламберт считает, что Fable 5 в роли учителя вряд ли повлияла на Kimi K3 или GLM-5.2, хотя может повлиять на более поздние модели.

К тому же post-training смещается в сторону multi-teacher on-policy distillation (MOPD) наряду с RL. Чем больше шагов в рецепте, тем сложнее отследить вклад ранней стадии SFT. Сейчас RL даёт куда большую долю итоговой производительности, чем раньше. Когда SFT на базовой модели обеспечивал основной прирост при post-training, дистилляция значила больше. Ламберт ожидает, что этот тренд сохранится.

Лучший учитель часто не лучшая модель

Последний тезис кажется ему самым интересным. В SFT сильнейшая модель часто оказывается не самым удобным учителем для встраивания в пайплайн. В OpenThoughts и Olmo, ведущих полностью открытых проектах по reasoning-SFT, возникали трудности при переходе на сильнейшие модели-учителя; лучшим учителем нередко оказывалась менее крупная, неожиданная модель. Так что дистилляция, возможно, держится вовсе не на ультрасовременных моделях.

Из этого он делает два вывода. Сильные модели с открытыми весами лишают смысла обращение к API Claude или GPT, что ставит под сомнение утверждение, будто открытые модели занимаются "отмыванием дистилляцией" (distillation washing) проприетарных систем. К тому же из открытых моделей может быть банально проще дистиллировать, поскольку их легче модифицировать. Глава книги, на которую он ссылается, rlhf-book-synthetic-data-distillation, содержит техническую базу по on-policy дистилляции и MOPD.

Как это соотносится с другими его текстами

Пост развивает аргумент о роли RL из how-much-does-distillation-matter-for-chinese-llms (февраль 2026 года), подробнее описывая, на каком этапе данные от учителя попадают в пайплайн. Он был опубликован за несколько недель до stealing-reasoning-traces-from-proprietary-llm-apis и сентябрьского отчёта Anthropic. В том отчёте описывается, как Alibaba переводила цепочки рассуждений (chain-of-thought) Opus в SFT-данные для Qwen 3.5-3.7, а Xiaomi прогоняла пользовательские сессии через Claude, собирая данные "как для SFT, так и для RL". Акцент на SFT согласуется с описанием Ламберта. Однако объём - 151 миллион диалогов только у Alibaba - несоизмеримо больше тех "совсем небольших выборок", из которых исходил автор. В сентябре его список литературы стал более реалистично оценивать потенциальный эффект извлечения трасс рассуждений (см. llm-distillation).