Рубежи синтетических данных
- title
- Рубежи синтетических данных
- type
- summary
- summary
- Заметки Ламберта 2024 года о синтетических данных в post-training: от SFT на ответах GPT-4 до дистилляции Gemini Flash из Pro.
- tags
- ai, llm, distillation, synthetic-data, post-training, open-weights
- sources
- frontiers-in-synthetic-data
- created
- 2026-09-14
- updated
- 2026-09-14
- lang
- ru
- translation_of
- frontiers-in-synthetic-data
- source_updated
- 2026-09-14
- translated
- 2026-09-14
- translator
- lllm/antigravity/gemini-3.7-flash-medium
Нейтан Ламберт написал этот текст в июне 2024 года в interconnects, когда запускал проект по дообучению сильной open-weight базовой модели до максимально возможного уровня с помощью синтетических данных. Целью проекта был открытый fine-tune, сокращающий большую часть разрыва с frontier-моделями, где каждый этап пайплайна полностью публичен. Сам пост - это его инвентаризация того, что крупные лаборатории, вероятно, уже применяли на практике, пока академическая литература это упускала. Два года спустя он поместил его в конец своего open-source-ai-reading-list как историческую справку для llm-distillation. Материал полезен как отправная точка: он фиксирует, что понималось под "дистилляцией" до появления reasoning-моделей, масштабного RL и политических споров вокруг китайских лабораторий.
Дистилляция как SFT на текстах более сильной модели
В 2024 году рабочим значением дистилляции было обычное supervised fine-tuning на ответах более сильной модели. Ламберт отсчитывает эту фазу от Zephyr-Beta, авторы которой вынесли слово "дистилляция" прямо в название статьи. При этом он сразу указывает на неравномерность результатов. Открытые запросы вроде "напиши мне письмо" или "сократи этот текст" легко скопировать у GPT-4, и большинство базовых бенчмарков (MT-Bench, AlpacaEval) поощряют именно это. Код, корректно использующий умеренно популярную библиотеку, или сложная математика даются куда труднее, поскольку модель-учитель сама регулярно ошибается на таких задачах.
Он также отмечает, насколько устарели многие наборы данных, созданные с помощью GPT-4. В них использовался снимок GPT-4, отстававший примерно на 100 баллов от актуальной тогда GPT-4o в LMSYS Chatbot Arena - ровно такая же дистанция отделяла оригинальную GPT-4 от крайне непопулярной Llama-2-chat-70B. Поэтому повторная генерация старого датасета с более новым учителем может заметно улучшить результат, хотя на тот момент никто точно не знал, какой учитель и какие параметры сэмплинга лучше подходят для конкретной задачи.
Дистилляция по логитам в крупных лабораториях
Более техническое утверждение касается небольших и дешёвых моделей. Ламберт предположил, что Gemini Flash и Claude Haiku, скорее всего, были дистиллированы, а не обучены с нуля, сославшись на статью Google об on-policy дистилляции (Agarwal et al.), которую её ведущий автор назвал своей самой результативной продуктовой работой. Дополнение к посту подтвердило это наполовину: обновлённый отчёт по Gemini 1.5 прямо указывает, что Flash - это dense-модель, полученная методом "online distillation" из Gemini 1.5 Pro (архитектура MoE). При таком подходе маленькая модель обновляется параллельно с обучением большой. Ламберт предположил, что у Anthropic и Google есть такие возможности, а у OpenAI их может и не быть. Второе дополнение ведёт на разбор on-policy дистилляции от Льюиса Танстолла из Hugging Face. Глава rlhf-book-synthetic-data-distillation возвращается к этому направлению уже в 2026 году, когда on-policy дистилляция стала стандартным методом post-training'а.
Фильтрация и накопление вместо замкнутых циклов
Статьи по итеративному DPO были тогда самым модным направлением в исследованиях alignment'а. Большинство из них сводилось к повторной генерации или переразметке одного датасета с демонстрацией баллов AlpacaEval, которые Ламберт называет слегка абсурдными. Индустриальные отчёты выглядели иначе. И для Llama 2, и для Nemotron 340B проводилось несколько раундов alignment'а с постоянным добавлением новых данных между ними, причём оба проекта применяли жёсткую фильтрацию: Meta использовала Llama 2 для создания классификаторов качества данных претрейна Llama 3, а отчёт Nvidia по Nemotron в основном посвящён reward-модели, отсеивающей диалоги с низкими оценками. Ламберт связывает это с работами, показывающими, что накопление данных между итерациями предотвращает схлопывание мод (mode collapse), возникающее при простом переобучении модели на её собственных ответах. Открытым оставался вопрос, почему никто не описал правила такой фильтрации под конкретные задачи и модели.
Условия использования и разрыв в доступности учителей
Крупные компании не могли использовать те же синтетические данные, что академические исследователи и энтузиасты. Модели Hermes от Nous Research активно опирались на GPT-4, тогда как Nvidia была ограничена моделями с разрешительными лицензиями вроде Mistral или собственными генерациями. Для открытого сообщества право использовать GPT-4, Gemini Pro и Claude 3 в качестве учителей было большим преимуществом перед такими лабораториями, как Meta. Ламберт заметил, что опасения по этому поводу к 2024 году утихли: небольшие игроки спокойно обучались на выводах API, и никого это не беспокоило. Он добавляет, что пункты о запрете обучения на ответах моделей часто исходили от поставщиков данных для самих создателей моделей, защищавших собственный бизнес. Пост 2026 года how-much-does-distillation-matter-for-chinese-llms снова разбирает этот пункт соглашений, направленный к тому моменту уже против китайских лабораторий.
Датасеты от множества учителей
UltraFeedback и Nectar были стандартными датасетами предпочтений, и оба смешивали ответы почти всех существующих поколений моделей. Ламберт подозревает, что это ограничивает их потенциал: студенту приходится учить последовательности, маловероятные для его собственного распределения (например, характерные фразы GPT-4 при обучении базы Llama 3), и никто точно не знает, как этот loss влияет на модель. Он ожидал, что on-policy генерация с последующей фильтрацией покажет себя лучше. При этом в дополнении он признаёт, что авторам UltraFeedback не удалось превзойти свой же датасет с помощью UltraInteract, так что в академической среде смешанный подход всё ещё побеждал.
Где открывались возможности
В конце поста выделены три перспективных направления. Первое - проверяемые синтетические данные: сначала для соблюдения формата инструкций вроде "ответь в JSON" (с прицелом на IFEval), а затем для заведомо исполняемого кода и математических выкладок с гарантированно верным решением. Второе - обобщение от слабого к сильному (weak-to-strong generalization), где он цитирует вывод отчёта Nemotron о том, что уровень учителя не стал потолком для студента. Третье - промпты, которые он считает главным узким местом: синтетические данные начались с self-instruct, метода генерации самих промптов, а авторы Nemotron генерировали собственные синтетические промпты даже при наличии LMSYS-Chat-1M.
Многие из этих прогнозов подтвердились в его более поздних работах. Проверяемые reward'ы легли в основу RL для reasoning-моделей, а в заметке за июль 2026 года how-distillation-is-used-today он отмечает, что получение качественных промптов - часто самая трудная часть подготовки SFT-датасета. Тезис о превосходстве студента над учителем возвращается в 2026 году как аргумент в пользу того, что китайские модели не ограничены уровнем американских систем, на которых они обучаются.