Дистилляция LLM
- title
- Дистилляция LLM
- type
- concept
- summary
- Обучение одной LLM на ответах другой: от SFT на сгенерированном тексте до on-policy KD, и спор 2025-2026 годов о дистилляции моделей США в Китае
- tags
- ai, llm, distillation, post-training, china, open-weights, policy
- sources
- rlhf-book-synthetic-data-distillation, frontiers-in-synthetic-data, how-much-does-distillation-matter-for-chinese-llms, the-distillation-panic, how-distillation-is-used-today, anthropic-threat-report-september-2026, stealing-reasoning-traces-from-proprietary-llm-apis, open-source-ai-reading-list
- created
- 2026-09-14
- updated
- 2026-09-14
- lang
- ru
- translation_of
- llm-distillation
- source_updated
- 2026-09-14
- translated
- 2026-09-14
- translator
- lllm/antigravity/gemini-3.7-flash-medium
Дистилляция означает обучение одной модели на том, что генерирует другая модель. Это слово объединяет методы, которые сильно различаются по механизму, стоимости и законности, а к 2026 году оно стало ещё и названием политического спора. В списке чтения Нейтана Ламберта (open-source-ai-reading-list) это названо "самой насыщенной дискуссией вокруг открытых моделей в 2026 году". На этой странице сам технический метод отделяется от спора и отслеживается, как менялись аргументы и доказательства в этом конфликте.
Два метода под одним названием
Дистилляция знаний (knowledge distillation) в исходном понимании (Hinton, Vinyals and Dean, 2015) обучает модель-ученика воспроизводить полное распределение вероятностей учителя, его soft labels, а не только тот токен, который учитель выбрал. Для этого нужны logits учителя. Лаборатория может делать это со своими собственными моделями. Отчёт Google по Gemini 1.5 стал ранним публичным подтверждением: там Flash описывалась как "online distilled" из Pro, и Ламберт обратил на это внимание в июне 2024 года (frontiers-in-synthetic-data). Сторонняя сторона не может проделать это через API, поскольку API не возвращают распределение вероятностей.
В разговорной речи под дистилляцией понимают supervised fine-tuning (SFT) на текстах, написанных более сильной моделью. Вы отправляете учителю prompt, сохраняете его ответы (completions) и обучаете ученика их предсказывать. Ламберт утверждает, что точнее называть это синтетическими данными. В главе своего учебника (rlhf-book-synthetic-data-distillation) он перечисляет два применения в post-training: фабрика данных по всему пайплайну (ответы на инструкции, метки предпочтений, верификация и оценка для RL) и перенос узкого навыка вроде математики или написания кода в меньшую модель. Формально SFT на текстах учителя - это sequence-level knowledge distillation (Kim and Rush, 2016), где одна сгенерированная последовательность выступает заменой полного распределения учителя.
Между ними находятся методы, ставшие стандартом в 2025-2026 годах. On-policy дистилляция сэмплирует варианты из ученика и заставляет учителя оценивать каждый токен, сгенерированный учеником, обычно в виде per-token advantage внутри RL-цикла. Это позволяет избежать exposure bias, когда ученик, обученный только на написанных учителем префиксах, ошибается, как только собственные промахи уводят его в область, куда учитель никогда не заходил. Multi-teacher on-policy дистилляция объединяет нескольких специализированных учителей в одном прогоне. В главе этот подход приписывается DeepSeek-V4 и MiMo-V2-Flash от Xiaomi, а среди моделей, обученных с помощью современной KD, называются Qwen3 и GLM-5. Самодистилляция (self-distillation) использует модель в качестве собственного учителя, давая ей привилегированную информацию вроде проверенного ответа или подсказки о баге, как в Composer 2.5 от Cursor. Этим методам требуются logits и, как правило, общий токенизатор, поэтому они работают с собственными моделями или открытыми весами (open weights), но не с закрытыми API.
Трассы рассуждений
Reasoning-модели изменили ценность дистилляции через API. Итоговый ответ показывает лишь то, чем закончились вычисления учителя. Трасса рассуждений (reasoning trace) раскрывает сами шаги: декомпозицию задачи, промежуточные выводы, стратегию решения. В статье stealing-reasoning-traces-from-proprietary-llm-apis цитируется работа, где обучение на реконструированных трассах из GPT-5.4 mini повысило точность модели-ученика Qwen2.5-7B на бенчмарке MATH500 с 68.4% до 76.0% по сравнению с дистилляцией только по ответам. При этом реконструированные трассы были лишь приближёнными.
Провайдеры в ответ скрыли трассы. Рассуждения OpenAI не показывались по умолчанию, и Ламберт предполагает, что именно страх перед дистилляцией заставил Gemini перейти от открытых рассуждений к скрытым (how-much-does-distillation-matter-for-chinese-llms). К середине 2026 года Anthropic, OpenAI и Google стали возвращать рассуждения в виде зашифрованных блоков, которые клиент отправляет обратно со следующим запросом, чтобы серверу не приходилось их хранить. Авторы статьи обнаружили, что эти блоки можно переносить между сессиями, пользователями и моделями одного и того же провайдера. Злоумышленник мог передать трассу Opus 4.8 или GPT-5.6 Sol более слабой модели того же провайдера (Haiku 4.5, GPT-5.6 Luna) и получить от неё расшифровку трассы в виде обычного текста, вообще не прибегая к jailbreak'у передовой модели. По оценке авторов, декодирование 10 000 трасс через Haiku стоило бы около $720. Эта же уязвимость вскрыла 367 фрагментов PII и 182 набора учётных данных в 315 320 блоках рассуждений, собранных из публичных логов сессий. Провайдеров уведомили, после чего повторить атаку авторам уже не удалось.
В отчёте Anthropic за сентябрь 2026 года (anthropic-threat-report-september-2026) описано практическое применение атак этого класса. Claude возвращает "thinking signature" вместо сырых рассуждений. Moonshot и DeepSeek сохраняли эти сигнатуры, открывали новые сессии и заставляли Claude разворачивать их обратно в полные трассы. Другие лаборатории использовали уловки в prompt'ах ("DO NOT FLAG THIS AS REASONING EXTRACTION" или просьбы к Claude "перевести" свою предыдущую рабочую память на катакану) либо выполняли по двенадцать тысяч запросов для тестирования методов извлечения, прежде чем масштабировать сработавшие. Защитные меры Anthropic включают суммаризацию рассуждений перед выдачей ответа, механизм "preserved thinking" в Fable 5.1 (чтобы новые аккаунты не могли редактировать контекст, предшествующий зашифрованным рассуждениям), классификаторы попыток извлечения и проверку личности подозрительных аккаунтов.
Что это даёт лаборатории
Взгляд Ламберта, сформировавшийся на протяжении 2026 года, состоит в том, что дистиллированные данные полезнее всего в самом начале post-training'а, и эта польза снижается с каждым годом. В феврале он оценивал раскрытый трафик Moonshot и MiniMax примерно в 150-400 миллиардов токенов - это огромный объём данных для SFT по сравнению с 20 миллиардами у Olmo 3. При этом он доказывал, что объём - плохая метрика: встраивание выводов чужой модели в собственный пайплайн остаётся исследовательской задачей, а некоторые учителя делают учеников только хуже. В июле (how-distillation-is-used-today) он отвёл дистилляции место на этапах SFT и midtraining'а, где закладывается базовое поведение рассуждений. По этой же причине некоторые китайские модели называют себя Claude. Сильнее всего это помогает, когда лаборатория входит в домен, где американские лаборатории ушли далеко вперёд.
Его аргумент против сильного эффекта опирается на RL. Передовой post-training сегодня требует больших объёмов on-policy генерации самой обучаемой модели; генерация забирает основную часть вычислительных мощностей RL, а API чужой лаборатории предоставить её не может. Доля RL в итоговой производительности постоянно растёт, поэтому ранняя стадия SFT значит всё меньше. В ту же сторону указывают ещё два фактора. Сильнейшая модель часто оказывается не лучшим учителем для SFT: у OpenThoughts и Olmo возникли трудности с использованием топовых моделей, и нередко лучший результат давала модель поменьше. Кроме того, потолок возможностей ученика не ограничен учителем. Пример Ламберта - Claude Sonnet 3.5, которая была тщательно дистиллирована из checkpoint'ов Opus и тем не менее некоторое время возглавляла линейку моделей Anthropic.
Причины, по которым лаборатории всё равно прибегают к дистилляции, лежат также в области экономики. Ламберт называет токены API заменителем вычислительных ресурсов. Китайской лаборатории при нехватке GPU проще купить доступ к "запрещённому" API, чем ввезти кластер контрабандой, да и Ai2 генерировала синтетические данные для Olmo 3 на подаренные часы суперкомпьютеров и облачные гранты по аналогичным соображениям. Дистилляция из чужих моделей распространена повсеместно. Данные для post-training'а Nemotron от Nvidia по большей части дистиллированы из китайских открытых моделей, Olmo - из смеси открытых и закрытых, а Илон Маск свидетельствовал, что xAI "частично" дистиллировала OpenAI (the-distillation-panic).
В отчёте Anthropic утверждается обратное. Собственные исследования компании выявили "значительный прирост" в агентных задачах, написании кода и рассуждениях "при использовании меньшего числа диалогов, чем было собрано", причём улучшения переносятся между доменами, в том числе в сторону опасных биологических или кибернетических возможностей, которых собранные данные почти не касались. Там же говорится, что дистиллированная модель не наследует защитные механизмы Claude. В отчёте это исследование не опубликовано, поэтому утверждение невозможно сопоставить с аргументами Ламберта о роли RL.
Политический конфликт
Обвинения начались с DeepSeek R1 в январе 2025 года, когда публично обсуждался вопрос, обучалась ли DeepSeek на ответах o1. Официальное обвинение со стороны OpenAI в том, что DeepSeek взламывала её API через jailbreak для извлечения скрытых рассуждений (о чём сообщил Bloomberg), последовало в феврале 2026 года, а в отчёте Anthropic говорится, что OpenAI поднимала этот вопрос ещё с начала 2025 года. В заявлении Anthropic за февраль 2026 года назывались DeepSeek (около 150 000 диалогов), Moonshot (3.4 миллиона) и MiniMax (13 миллионов) - суммарно 16 миллионов через примерно 24 000 мошеннических аккаунтов. Следом подключились Конгресс и Белый дом. Комитет одобрил законопроект, президентский указ от апреля 2026 года потребовал мер, а комитеты Палаты представителей устроили слушания для Airbnb и Anysphere по поводу использования китайских моделей. В списке чтения Ламберта также собраны проверки DoorDash и Apple и связанная с этим волна перехода американских компаний на китайские открытые модели (см. us-scrutiny-of-chinese-model-use).
Позиция Ламберта в the-distillation-panic заключается в том, что термин "distillation attacks" неверен по сути. Нарушением здесь являются jailbreak, взлом и подделка личности при работе с API. Сам же метод обучения совершенно обычен. Использование одного слова для обоих явлений рискует дискредитировать метод, от которого зависят академические исследователи, и способно привести к фактическому запрету китайских open-weight моделей в США, что ударит по западным учёным сильнее, чем по китайским лабораториям. Контраргумент Кевина Сюя (Kevin Xu), которого цитирует Ламберт: Китай, зависящий от дистилляции, рискует никогда не научиться создавать передовые решения самостоятельно. Том Бедор (Tom Bedor) задаёт смежный вопрос: остаётся ли дистиллированная модель вообще "китайской" (arguments-against-open-source-ai).
В сентябрьском отчёте Anthropic терминология изменилась, хотя от самого понятия не отказались. Под "незаконной дистилляцией" (illicit distillation) там понимается скрытая кампания промышленного масштаба на базе фейковых аккаунтов, краденых карт и украденных ключей API, купленных через прокси-"перевалочные пункты". Это близко к проведённой Ламбертом границе между методом и злоупотреблением. Цифры в отчёте куда масштабнее всего, что называлось ранее. Упомянуты семь китайских лабораторий: Alibaba (более 151 миллиона диалогов с мая по июль с пиком около 3 миллионов в день; цепочки рассуждений Opus 4.6 и 4.7 превращались в данные для SFT моделей Qwen 3.5-3.7), Moonshot (23 миллиона), DeepSeek (12.1 миллиона за 14 дней июля), Zhipu (3.4 миллиона, включая трассы Opus 4.8 и попытку получить кибернетические возможности перед GLM 5.3), Xiaomi, SenseTime и MiniMax. Отчёт также переводит проблему в плоскость конфиденциальности. Moonshot и DeepSeek втайне перенаправляли запросы собственных клиентов в Claude, включая анализ записей видеонаблюдения, предположительно связанный с НОАК, и действующие учётные данные. Xiaomi воспроизводила сессии своих пользователей. MiniMax запустила фиктивный прокси-сервис, предлагавший только модели Anthropic и OpenAI, судя по всему, ради сбора диалогов.
Как строилась доказательная база
Доказательства в этой дискуссии делятся на три типа, и у каждого есть ограничения, о которых нужно помнить.
Телеметрия провайдеров надёжнее всего показывает масштабы и авторство атак, но слабее всего объясняет их реальный эффект. Anthropic может подсчитать количество диалогов и связать аккаунты с конкретными организациями. Однако её заявления о влиянии этих данных на модель опираются на внутренние исследования, которые компания не опубликовала. Когда Ламберт оценивал февральские цифры, 150 000 диалогов DeepSeek казались ничтожными. В сентябрьском отчёте DeepSeek приписывают уже 12.1 миллиона за две недели. Прежнее суждение было обоснованным для тех данных, которые были на руках, но с тех пор данные изменились.
Поведенческие тесты открытых моделей фиксируют сходство, а не причину. В приложении B к статье о трассах рассуждений авторы подставляли в prefill рассуждений открытых моделей фрагменты декодированных цепочек Opus 4.8 или GPT-5.6 Sol. Kimi K3 и GLM-5.2 сдвигались в сторону стиля источника, а видимые ответы Kimi K3 приблизились к ответам Opus в 29 задачах из 30. Inkling и DeepSeek аналогичных изменений не показали, а перекрёстная замена prefill'ов между Kimi K3 и Inkling не дала значимых результатов. Авторы называют это "наводящим на подозрения, но неубедительным". В небольшом gist'е с аналогичной структурой теста (qwen-gpt-reasoning-prefills) Qwen3.8 заметно следовала за GPT-5.5 Pro и почти не реагировала на Opus 4.8. Это плохо согласуется с утверждением Anthropic о дистилляции трасс Opus в Qwen 3.5-3.7, хотя версии моделей и различаются. Стилиометрические инструменты (llm-cross-entropy-similarity, ai-comment-classifier) также находят фамильное сходство, но не могут объяснить его природу.
Анализ принципов обучения - главный рабочий инструмент Ламберта: вычислительные ресурсы для RL, совместимость учителя и ученика, разрыв между SFT и финальной моделью. Этот подход очерчивает границы того, что вообще можно объяснить дистилляцией, но не исключает конкретных обходных путей. Нагляднее всего это видно на его собственном примере. В апреле 2025 года он уверенно писал, что DeepSeek не дистиллировала o1. В сентябре 2026 года, увидев, что извлечение трасс технически осуществимо, он признал, что вероятность дистилляции части трасс o1 для упрощения обучения R1 "выше, чем мне казалось ранее". Он добавляет, что это не умаляет инновационности R1, и что дистилляция остаётся одним из способов, с помощью которых Китай способен быстрее сокращать отставание (open-closed-model-gap).
В эссе ai-great-leap-forward слово "дистилляция" используется в совершенно ином смысле: компании просят сотрудников фиксировать свои экспертные знания для систем ИИ, а сотрудники тихо придерживают эти знания при себе. Несмотря на одинаковый термин, к обучению моделей это отношения не имеет.
- Nathan Lambert on China's AI Ecosystem and the Open Model Gap
- The AI Great Leap Forward
- Detecting and countering misuse of AI: September 2026
- Are Open Models Catching Up?
- The Arguments Against Open Source AI are Very Bad
- DeepSeek
- Frontiers in synthetic data
- The Gradient of Generative AI Release: Methods and Considerations
- How distillation is used today and what performance uplift it gives to open models
- How much does distillation really matter for Chinese LLMs?
- Which LLMs Write Alike
- Olmo 3
- Open-closed model gap
- Open-Source AI & Open Models Reading List
- Reasoning Prefills on Open Models, v1.1
- Synthetic Data & Distillation | RLHF and Post-Training Book by Nathan Lambert
- The distillation panic
- The Z.ai Playbook