Синтетические данные и дистилляция | Книга Нейтана Ламберта по RLHF и post-training
- title
- Синтетические данные и дистилляция | Книга Нейтана Ламберта по RLHF и post-training
- type
- summary
- summary
- Глава из книги Ламберта по RLHF о синтетических данных: от дистилляции для SFT и on-policy KD до AI feedback, Constitutional AI и рубрик
- tags
- ai, llm, distillation, synthetic-data, post-training, reinforcement-learning
- created
- 2026-09-14
- updated
- 2026-09-14
- lang
- ru
- translation_of
- rlhf-book-synthetic-data-distillation
- source_updated
- 2026-09-14
- translated
- 2026-09-14
- translator
- lllm/antigravity/gemini-3.7-flash-medium
Это глава из книги. Учебник Нейтана Ламберта Reinforcement Learning from Human Feedback посвящён post-training, вышел в 2026 году и доступен бесплатно на rlhfbook.com, где эта глава находится по адресу /c/12-synthetic-data. Она ссылается на другие главы по номерам: policy gradients в 6, проверяемые награды в 7, KL-дивергенция в 15, оценка в 16, обучение характеру (character training) в 17. В open-source-ai-reading-list она указана как вводное чтение по дистилляции. Это обзор с формулами и цитатами. Автор не занимает никакой позиции в нормативном споре, описанном в the-distillation-panic, хотя Ламберт цитирует определение из этой главы в том посте.
Глава начинается с исторического контекста. RLHF изначально опирался на данные от людей, поскольку когда-то люди были единственным источником качественных ответов и надёжной обратной связи. Когда модели стали лучше, синтетические данные удешевили эксперименты, и именно эта дешевизна во многом обеспечила широкое распространение RLHF.
Где синтетические данные победили, а где нет
Коллапс модели (model collapse) - представление о том, что обучение на собственных выводах модели сужает распределение вплоть до исчезновения редких фактов, - рассматривается как реальный, но предотвратимый сбой. Он проявляется в основном при неотфильтрованном, повторяющемся самообучении на базе одной модели. Добавление данных от людей, использование нескольких учителей, дедупликация и фильтрация позволяют пайплайну избегать этого режима, и в главе утверждается, что передовые пайплайны должны масштабно использовать синтетические данные.
Синтетические данные стали полезными с появлением моделей класса GPT-4. Llama 2 и GPT-3.5-Turbo были недостаточно надёжны для генерации или разметки данных, а подход LLM-as-a-judge по-настоящему заработал только при переходе к GPT-4. Размеры датасетов наглядно показывают этот сдвиг: в Alpaca было 52 тыс. промптов и около 10 млн токенов, в Tülu 3 - около 500 млн токенов, а в OpenThoughts 3 - порядка 10 млрд.
Результат зависит от типа данных. Для SFT синтетические данные в основном победили: дистиллированные ответы превосходят то, что способно масштабно выдавать большинство авторов-людей. Для данных о предпочтениях академические результаты показывают, что синтетические данные работают примерно так же хорошо, однако передовые лаборатории по-прежнему считают предпочтения людей своим конкурентным преимуществом (moat). Для оценки модели дёшево выставляют баллы, в то время как люди всё ещё пишут бенчмарки и эталонные ответы (ground truth). Синтетические данные выигрывают там, где модели надёжнее людей. Люди остаются на переднем крае возможностей и задают эталонную истину.
Два значения дистилляции
Строгое значение восходит к Hinton et al. (2015): модель-ученик (student) обучается на мягких метках (soft labels) модели-учителя (teacher). Разговорное значение - это обучение на результатах работы более сильной модели. В post-training разговорный вариант используется в двух направлениях. Первое - как генератор данных для всего пайплайна (ответы на инструкции, данные предпочтений или Constitutional AI, верификация для RL). Второе - перенос конкретного навыка, например математики или написания кода, в более компактную модель. Лаборатории держат крупные внутренние модели вроде Claude Opus или Gemini Ultra отчасти для генерации таких данных, а открытые модели обычно дистиллируются из закрытых API, начиная ещё с Zephyr. Важнее всего здесь отбор промптов и фильтрация ответов.
От offline к on-policy дистилляции знаний
Самый технический раздел объясняет, почему дистилляция по схеме "учитель - ученик" вернулась, когда рассуждающие (reasoning) и агентные модели заняли центральное место в post-training. В главе упомянуты Qwen3, MiMo-V2-Flash от Xiaomi, GLM-5 от Zhipu и DeepSeek-V4-Pro как модели, обученные с использованием её более новых форм.
Ким и Раш (Kim and Rush, 2016) адаптировали дистилляцию знаний для последовательностей. Пословная KD (word-level KD) сопоставляет распределение следующего токена учителя на каждой позиции. Попоследовательностная KD (sequence-level KD) заменяет невычислимую сумму по всем последовательностям одним выводом учителя, полученным через beam search, что сводится к обычной кросс-энтропии на тексте, сгенерированном учителем. В главе это семейство названо offline KD, поскольку обучающий текст генерируется заранее. К нему относятся DistilBERT и TinyBERT. При фиксированном учителе минимизация кросс-энтропии эквивалентна минимизации прямой KL-дивергенции (forward KL) от учителя к ученику - направление, используемое в SFT.
Обучение в режиме offline приводит к проблеме смещения условий (exposure bias). Ученик обучается на префиксах, написанных учителем, но генерирует на основе собственных префиксов, поэтому один неудачный токен уводит его в незнакомую область, где вероятность совершить очередную ошибку выше. В главе заимствуется оценка из обучения с подражанием (imitation learning), лежащая в основе DAgger, где ошибка растёт как O(εL²) относительно длины последовательности L, и преподносится как аналогия для LLM, а не как строгое доказательство. На тысячах токенов такой рост сказывается особенно болезненно.
On-policy дистилляция (OPD) сэмплирует из ученика и просит учителя оценить состояния, которых ученик фактически достигает, что, согласно анализу DAgger, снижает накопление ошибки до O(εL). Целевой функцией становится обратная KL-дивергенция (reverse KL) от ученика к учителю (MiniLLM; Agarwal et al.). В современных реализациях её встраивают прямо в RL: потокенное преимущество (advantage) равно логарифму вероятности сэмплированного токена у учителя минус логарифм у ученика, следуя описанию Thinking Machines. Это даёт плотную обратную связь на уровне токенов вместо единичной разреженной награды. Учителю и ученику обычно требуется одинаковый токенизатор, что нетипично для методов post-training.
Варианты
Multi-teacher OPD (MOPD, из отчёта по MiMo-V2-Flash) взвешивает нескольких специализированных учителей для каждого промпта, благодаря чему разные команды могут обучать экспертов по математике, коду или другим областям, которые затем обучают единую общую модель. В главе указано, что DeepSeek-V4 и MiMo-V2-Flash обучались именно так. При on-policy самодистилляции (OPSD) модель выступает в роли собственного учителя, используя привилегированную информацию - например, проверенный ответ или результаты работы инструментов. Composer 2.5 от Cursor, дообученный на базе Kimi K2.5, использовал одну из её версий. Модель-судья с промптом, содержащим список типичных багов, анализирует траектории RL, вставляет подсказку там, где находит баг, а лосс дистилляции вычисляется на исправленной последовательности. В качестве эксперимента глава предлагает запустить SDPO - родственный метод самодистилляции - на учебной задаче обращения строк (string-reversal) на одном GPU.
AI feedback, Constitutional AI и рубрики
Вторая половина главы посвящена AI feedback. Разметка предпочтений человеком стоит $1 и более, иногда свыше $10 за промпт, тогда как обратная связь от передовой модели обходится дешевле цента. Эмпирическое правило Ламберта: данные от людей обладают высоким шумом и низким смещением (high-noise, low-bias), а синтетические данные предпочтений - низким шумом и высоким смещением (low-noise, high-bias), из-за чего с них легко начинать, но они подвержены незаметным систематическим побочным эффектам. В более поздних работах сложные примеры направляются людям, а остальные - моделям. Специализированные модели-судьи (Prometheus, Auto-J, Shepherd, CritiqueLLM) существуют, но редко встречаются в задокументированных рецептах, поскольку передовые модели уже тщательно обучены выступать в роли судей.
Constitutional AI описан как самый ранний задокументированный пример масштабного использования синтетических данных в RLHF. Модель критикует и перерабатывает свои ответы в соответствии с прописанными принципами для получения данных SFT, а также выбирает лучший из двух ответов с учётом выбранного принципа для формирования данных о предпочтениях. Среди связанных тем глава рассматривает Model Spec от OpenAI и deliberative alignment.
Глава завершается темой рубрик (rubrics). Это составляемые моделью списки взвешенных критериев под каждый промпт, дающие почти проверяемые награды для запросов без однозначно проверяемого ответа; они позволили распространить RL на научные рассуждения, фактологическую точность и deep research. В тексте приведены три полных промпта для генерации рубрик. Такое же оценивание по рубрикам фигурирует в февральском отчёте Anthropic за 2026 год об использовании Claude компанией DeepSeek "в качестве reward model", который обсуждается в how-much-does-distillation-matter-for-chinese-llms.
Заметка об источнике
Сохранённая библиография неполна. Пропущены пункты 5, 11, 16, 19, 30, 39, 40, 45, 65 и 67, включая ссылки на Qwen3, DeepSeek-V4, Zephyr и Composer 2.5 от Cursor, хотя текст цитирует их все. Математические формулы сохранены в виде экранированного LaTeX. О том, как таксономия из этой главы связана со спором 2026 года вокруг китайских лабораторий, см. в llm-distillation.