EnglishРусский Map
Open-Source AI & Open Models Reading List

Насколько дистилляция действительно важна для китайских LLM?

title
Насколько дистилляция действительно важна для китайских LLM?
type
summary
summary
Ламберт разбирает отчёт Anthropic за февраль 2026 о DeepSeek, Moonshot и MiniMax: дистилляция помогает, но не решает всё.
tags
ai, llm, distillation, china, open-weights, post-training, policy
created
2026-09-14
updated
2026-09-14
lang
ru
source_updated
2026-09-14
translated
2026-09-14
translator
lllm/antigravity/gemini-3.7-flash-medium

Нейтан Ламберт опубликовал этот текст на interconnects 24 февраля 2026 года - в день, когда Anthropic обвинила три китайские лаборатории в кампаниях дистилляции против Claude в "промышленных масштабах". Пост пытается ответить на один вопрос до перехода к политике: какой прирост производительности китайская лаборатория на самом деле получает от обучения на ответах американской модели? Его ответ: это помогает, иногда очень сильно для конкретной возможности, но это не то, что держит эти лаборатории вблизи фронтира. Это техническая половина пары материалов. Политическая половина вышла в мае под заголовком the-distillation-panic.

Что это слово означает сейчас

Ламберт разделяет два значения. Дистилляция знаний в смысле Хинтона, Виньялса и Дина (2015) обучает модель-ученика воспроизводить распределение вероятностей модели-учителя. Через API это сделать невозможно, поскольку API не возвращает распределение. То, что сегодня называют дистилляцией, - это синтетические данные: подать промпт более сильной модели, сохранить её ответы и обучать свою модель предсказывать их. Ламберт называет синтетические данные, пожалуй, самым полезным повседневным инструментом исследователя ИИ, и большая их часть вполне рутинна. Лаборатория тратит множество токенов сильной модели на очистку и доработку существующих данных - много вычислительных ресурсов ради небольшого числа качественных обучающих токенов.

Обвинения до отчёта Anthropic

Самый громкий случай до этого был связан с DeepSeek R1, вышедшей в начале 2025 года. OpenAI обвинила DeepSeek в извлечении цепочек рассуждений через джейлбрейк своего API, поскольку по умолчанию эти цепочки скрыты; отчёт Bloomberg, на который ссылается Ламберт, датирован 12 февраля 2026 года. Ламберт подозревает, что именно страх перед подобным извлечением объясняет, почему Gemini перестала показывать ход рассуждений и скрыла его, хотя ранние исследования рассуждений (статья s1) строились как раз на открытых цепочках Gemini.

Анализ цифр Anthropic

В публикации Anthropic насчитали более 16 миллионов диалогов через примерно 24 000 мошеннических аккаунтов. При этом Anthropic назвала дистилляцию "широко используемым и легитимным методом обучения", который передовые лаборатории применяют к собственным моделям. Anthropic не уточнила, шёл ли трафик через API, чат-приложение или claude-code.

Ламберт разбирает три лаборатории по очереди. DeepSeek указана первой, потому что это имя знакомо американцам, но её доля была небольшой: около 150 000 диалогов, охватывающих рассуждения, оценку по критериям (где Claude выступал в роли reward model) и безопасные с точки зрения цензуры ответы на чувствительные промпты. В масштабах обучения это всего лишь эксперимент, вероятно, одной небольшой команды, и Ламберт называет его влияние на следующую модель DeepSeek ничтожным. Использование Claude в качестве онлайн-оценщика для RL в принципе возможно, но крайне маловероятно при доступе, распределённом по стольким аккаунтам.

Moonshot (3,4 миллиона диалогов, нацеленных на агентные рассуждения, вызов инструментов, написание кода, computer use и зрение) и MiniMax (13 миллионов, нацеленных на агентный кодинг и оркестрацию) выглядят внушительнее. При 10-25 тыс. токенов на диалог в сумме они дают примерно 150-400 миллиардов токенов. Для сравнения, весь SFT-датасет Olmo 3 составлял около 20 миллиардов токенов, так что датасет в десять раз больше, собранный таким путём, вполне разумен. Ламберт считает выбор учителя логичным: Claude Opus 4.6 обладал непревзойдёнными возможностями агентной навигации, поэтому обучать на нём имело смысл попробовать, а само это преимущество сократится за несколько месяцев - точно так же, как учить математике сегодня способны уже многие модели.

Почему объём не равен приросту качества

Количество токенов - грубая метрика. Интеграция ответов другой модели в конвейер обучения - это исследовательская задача, и модели-ученики порой показывают худшие результаты на данных конкретного учителя по труднопредсказуемым причинам. Ламберт полагает, что китайские лаборатории хорошо справляются с этой задачей, поскольку они ограничены в GPU. Для организации, у которой денег больше, чем возможностей потратить их на вычислительные мощности, токены API - это способ купить вычисления. При этом получить доступ к "заблокированному" API куда проще, чем провезти контрабандой и смонтировать десятки тысяч GPU. Он отмечает, что западные лаборатории делают то же самое. Синтетические данные Olmo 3 были получены за счёт миллионов часов работы GPU на суперкомпьютере Frontier и грантов Azure через NAIRR - вычислительных мощностей, которыми Ai2 не владела.

Он также оспаривает два популярных утверждения. Китайские лаборатории не являются кардинально более эффективными, чем западные; они немного эффективнее в силу необходимости, привлекают сопоставимые таланты и подходят к бенчмаркам так, что кажутся ближе к лидерам, чем есть на самом деле (см. open-models-in-perpetual-catch-up и open-closed-model-gap). Кроме того, дистилляция не ставит потолок ученику ниже учителя. Claude Sonnet 3.5 некоторое время была флагманом Anthropic, опережая Opus, во многом благодаря качественной дистилляции из внутренних чекпоинтов Opus. Утверждать, что китайские модели никогда не превзойдут американские модели, из которых они дистиллируются, - это, по его сравнению, всё равно что заявлять, будто Sonnet никогда не смогла бы обойти Opus.

Аргумент про RL

Главная причина, по которой он ожидал угасания этой темы, - обучение с подкреплением (RL). Лучшим современным моделям необходим масштабный RL, а RL требует on-policy генерации от самой обучаемой модели. Генерация составляет большую часть вычислительных затрат на RL, и её нельзя отдать на аутсорс чужой модели. Учитель может помочь составить и отфильтровать промпты, но выполнять ресурсоёмкую часть ученику всё равно приходится самому. Опубликованные технические отчёты DeepSeek, Moonshot, Zhipu и других показывают сильную инфраструктуру RL, несмотря на дефицит вычислительных мощностей. Ламберт вернулся к этому аргументу в июле в how-distillation-is-used-today.

Политика

Условия обслуживания уже много лет запрещают использовать ответы API в "конкурентных целях". Академические исследователи и американские создатели открытых моделей спорили об этом пункте в 2022 и 2023 годах (как описано в frontiers-in-synthetic-data) и перестали беспокоиться в конце 2024 года, поскольку против небольших игроков этот запрет никто не применял. Ламберт рассматривает публикацию Anthropic как очередной шаг в росте напряжённости между США и Китаем. По его мнению, дистилляцию остановить гораздо труднее, чем поставки GPU, и ограничение продаж GPU значило бы намного больше. Его совет Anthropic - тщательно выбирать свои битвы: любая модель, доступная через API, будет использоваться для обучения её производных, и единственная надёжная защита - держать модель исключительно внутри собственных продуктов. При этом он не ожидает, что какая-либо из ведущих лабораторий откажется от своего API.

Как изменилась картина по более поздним данным

В посте масштабы DeepSeek оцениваются по 150 000 диалогов, о которых Anthropic сообщила в феврале. В сентябрьском отчёте Anthropic (anthropic-threat-report-september-2026) компании DeepSeek приписывают уже более 12,1 миллиона диалогов за 14 дней в июле 2026 года, а Alibaba - 151 миллион в период с мая по июль, включая извлечение цепочек рассуждений (chain-of-thought), которые, по утверждению Anthropic, вошли в Qwen 3.5-3.7. В том же отчёте утверждается, что дистилляция даёт "заметный прирост" при меньшем числе диалогов, чем собрали эти кампании. Таким образом, масштабы операций выросли далеко за пределы оценок этого поста, тогда как вывод Ламберта об их незначительном эффекте опирается на рассуждения об RL, которые более поздний отчёт напрямую не проверяет. За развитием этой дискуссии следит страница llm-distillation.