EnglishРусский Map

Prefill цепочек рассуждений в открытых моделях, v1.1

title
Prefill цепочек рассуждений в открытых моделях, v1.1
type
summary
summary
Тест с prefill'ом рассуждений: Qwen3.8 повторяет ход мыслей GPT-5.5 Pro сильнее других открытых моделей, что указывает на дистилляцию из GPT
tags
llm, distillation, evaluation, open-weights
created
2026-09-13
updated
2026-09-14
lang
ru
source_updated
2026-09-14
translated
2026-09-14
translator
lllm/antigravity/gemini-3.7-flash-medium

Короткий gist от wsxiaoys повторяет более ранний эксперимент с другим учителем. Идея в том, чтобы подставить в канал рассуждений открытой модели начало рассуждения другой модели и посмотреть, насколько сильно итоговый ответ открытой модели сместится в сторону ответа модели-учителя. Модель, обученная на выводах этого учителя, должна распознать след и пойти по нему; модель, которая никогда его не видела, не обратит на него внимания. В предыдущем раунде в роли учителя выступал Opus 4.8 (ссылка есть в gist'е, но в vault этой страницы нет); в версии 1.1 используется GPT-5.5 Pro. В качестве предшественника также упоминается "Stolen Thoughts".

Метод

Каждая целевая модель отвечает на каждую задачу дважды: один раз как обычно, а второй - с первыми 1% рассуждений GPT-5.5 Pro, вставленными в собственный канал рассуждений модели. Видимый ответ в обоих случаях генерируется свободно. Оценка показывает, какая доля видимого ответа GPT-5.5 Pro появляется в первых 100 токенах ответа целевой модели, и рассчитывается как средний recall исходного текста по униграммам, биграммам и триграммам. Набор состоит из 45 задач: 15 STEM, 15 не-STEM и 15 синтетических головоломок, последние описаны как приватные.

Результаты

Модель Без prefill'а С prefill'ом Дельта
DeepSeek V4 Flash 27.30% 26.13% -1.17 п. п.
Inkling 19.99% 20.45% +0.46 п. п.
Kimi K3 31.11% 35.65% +4.54 п. п.
Qwen3.8 A95B 16.79% 34.97% +18.18 п. п.

Скачок Qwen сохраняется во всех категориях: STEM вырастает с 19.26% до 46.24% (+26.99 п. п.), не-STEM - с 20.62% до 33.42% (+12.80 п. п.), головоломки - с 10.49% до 25.23% (+14.75 п. п.). Трактовка автора: в первом раунде Qwen почти не сдвигался в сторону Opus 4.8, но здесь сильно смещается в сторону GPT-5.5 Pro, в том числе на головоломках, которых точно не должно быть в чьих-либо обучающих данных, так что Qwen мог обучаться на GPT-5.5 Pro или близком родственнике из семейства GPT.

Вторая интересная строка - Kimi K3. У этой модели самое высокое совпадение с GPT-5.5 Pro как с prefill'ом, так и без него, но сам prefill почти ничего не добавляет. Высокое базовое перекрытие с малой дельтой и низкое базовое перекрытие с большой дельтой - это разные сигналы, и эксперимент выстроен именно вокруг второго.

Что это показывает, а что нет

Схема эксперимента разумна: дельта сравнивает модель с самой собой, поэтому базовые различия в стиле и многословности в основном нивелируются, а один и тот же prefill подаётся на вход всем моделям. Большой и устойчивый эффект у Qwen на фоне трёх почти не реагирующих моделей трудно списать на случайность.

Ограничения связаны с масштабом и нехваткой деталей: сорок пять задач, один прогон на каждое условие, дисперсия или повторные seed'ы не приводятся. Recall n-грамм по первым 100 токенам измеряет поверхностные формулировки, поэтому не позволяет отличить "обучение на выводах этого учителя" от "обучения на данных со схожими формулировками" - например, на общем upstream-датасете или на другой модели, дистиллированной из того же учителя. Кроме того, в gist'е не сказано, откуда взят текст рассуждений GPT-5.5 Pro и был ли это сырой trace или выжимка. Вывод сформулирован осторожно ("мог обучаться"), и дальше этих рамок имеющиеся данные не идут.

Связанные страницы

Ещё два стилометрических инструмента в vault'е указывают на схожее родство моделей другими путями. llm-cross-entropy-similarity сравнивает стиль генерации моделей с помощью символьных триграмм и начинается с пары Kimi K3 и модели от Anthropic. В ai-comment-classifier стилистическое перекрытие Kimi K2.7 и GLM со всеми остальными моделями оказалось настолько сильным, что их вероятностную массу пришлось перераспределять; автор предположил, что причина в дистилляции. Тест с prefill'ом отличается от обоих подходов: он оценивает реакцию модели на рассуждения другой модели, а не то, как выглядит её собственный текст без подсказок.

Утверждения о том, что открытые модели дистиллируются из передовых американских, поднимаются в arguments-against-open-source-ai, где ставится под сомнение, остаётся ли понятие "китайская модель" вообще устойчивой категорией в условиях дистилляции. swe-1-7 и needle представляют собой открыто декларируемые примеры связи типа "учитель-ученик", а kimi-k3 и deepseek описывают две из протестированных моделей. qwen3-8-flash-next охватывает линейку Qwen3.8 вокруг третьей, включая превью архитектуры Qwen4 Flash-Next, хотя и не саму протестированную здесь модель A95B.

Более масштабные свидетельства по этому вопросу появились позже. В приложении к stealing-reasoning-traces-from-proprietary-llm-apis авторы применяют полномасштабную версию этого метода и обнаруживают, что Kimi K3 и GLM-5.2 необычно сильно реагируют на рассуждения моделей Anthropic, хотя сами авторы подчёркивают, что это не доказывает дистилляцию. Это плохо стыкуется со скромным сдвигом K3 в данном тесте, хотя и учитель (Opus там, GPT-5.5 Pro здесь), и метрика различаются. А в anthropic-threat-report-september-2026 напрямую утверждается, что цепочки рассуждений Opus попали в Qwen 3.5-3.7 как SFT-данные - это более ранние версии Qwen, чем тестируемая здесь, и отчёт не даёт возможности проверить это заявление. В llm-distillation подобные свидетельства классифицируются по тому, что именно они способны и не способны показать.