EnglishРусский Map

Управляемый стиль рассуждений

title
Управляемый стиль рассуждений
type
concept
summary
Маркеры из обучающих данных, переключающие стиль рассуждений модели (chain-of-thought) без изменения пайплайна генерации ответа
tags
llm, prompt-engineering, reasoning-models
created
2026-04-25
updated
2026-04-25
lang
ru
source_updated
2026-04-25
translated
2026-09-01
translator
lllm/antigravity/gemini-3.7-flash-medium

Паттерн в современных reasoning-моделях, когда определённые маркерные фразы, вставленные в фиксированное место диалога, переключают стиль скрытого процесса рассуждений модели (блок ``), не меняя при этом пайплайн генерации финального ответа. Этот маркер заложен обучением: модель видела примеры в обучающей выборке, где маркер находился в конкретной позиции, а ассистент отвечал в соответствующем стиле рассуждений. Во время инференса передача такого маркера с высокой вероятностью воспроизводит нужный стиль.

Самый наглядный задокументированный пример - маркеры ролевого отыгрыша в DeepSeek-V4, которые переключают два стиля рассуждений для одной и той же задачи: глубокий внутренний монолог от первого лица против планирования сцены и стратегии от третьего лица.

Чем это отличается от prompt engineering

Обычный prompt engineering ("рассуждай пошагово", "отвечай кратко", "действуй в роли X") работает на уровне инструкций на естественном языке. Модель интерпретирует инструкцию и подстраивается, как может, обобщая обширные обучающие данные.

Обученный маркер стиля работает на уровне инъекции в обучающую выборку. Модель видела множество диалогов, где ровно этот маркер в ровно этой позиции предшествовал ровно такому стилю вывода. Его активация ближе к вызову сохранённого режима, чем к выполнению инструкции, которую модели нужно интерпретировать.

Отсюда вытекают следующие свойства:

  • Чувствительность к позиции. Маркер надёжно срабатывает только в том месте, куда его вставляли при обучении. В руководстве DeepSeek указан "конец первого сообщения пользователя"; тот же текст в системном промпте или на более поздней реплике теряет надёжность.
  • Чувствительность к формулировке. Близкие перефразирования снижают надёжность. Режим активирует именно та буквальная строка, на которой обучали модель.
  • Вероятностный характер, а не жёсткая фиксация. В отличие от control-токена (который детерминированно переключает поведение), обученный маркер лишь смещает вероятности генерации. Перегенерация ответа иногда помогает.
  • Сохранение в контексте диалога. Появившись в истории переписки, маркер заставляет модель придерживаться заданного стиля и на следующих репликах без повторного ввода фразы.

Что это говорит об обучении

Если модель надёжно меняет стиль рассуждений по конкретному маркеру в конкретном месте, естественное объяснение - обучающая выборка содержала два отдельных подмножества: одно с маркером в этой позиции и соответствующим стилем вывода, второе - без него. Модель выучила это условие. Из-за этого маркер вроде ролевого в DeepSeek становится инструментом зондирования обучающих данных: он показывает, что лаборатория подготовила датасет из пар (маркер, стиль рассуждений) как минимум для двух разных режимов CoT.

Это контрастирует с более привычным подходом (заметным в OpenAI o1/o3 и режимах extended thinking у Anthropic), где используется единственный стиль рассуждений, привязанный к варианту модели или переключателю на стороне сервера, без возможности управлять стилем со стороны пользователя.

Зачем лабораториям это делать

  • A/B-тестирование на продуктовых данных. Два стиля рассуждений можно эмпирически сравнивать по оценкам пользователей, используя маркер как метку распределения по группам.
  • Fine-tuning под конкретные домены. Ролевой отыгрыш, код, математика и аналитика требуют принципиально разных стилей рассуждений. Возможность управлять стилем со стороны пользователя избавляет от необходимости навязывать один режим повсеместно.
  • Внутренние и внешние персоны. Персонажу, которого отыгрывает модель, нужен один стиль рассуждений; мета-уровню, анализирующему пользователя, - другой.
  • Управление утечками формата. Если ход рассуждений открыт пользователю (DeepSeek его показывает, OpenAI прячет), возможность выбрать желаемый вид рассуждений становится важной.

Почему лаборатории могут это не документировать

Подобные маркеры обычно всплывают благодаря реверс-инжинирингу сообщества, а не из официальной документации:

  • Лаборатория не хочет, чтобы пользователи полагались на недокументированное поведение, которое могут изменить.
  • Маркеры могут быть побочным артефактом подготовки обучающих данных, который лаборатория не считает отдельной возможностью.
  • Такая возможность конкурирует с собственным интерфейсом продукта (переключатель Expert Mode и аналоги).
  • Вероятностное поведение трудно зафиксировать в официальном контракте API.

Смежные паттерны

  • Обученный формат системного промпта. Большинство чат-моделей лучше всего работают с системными промптами определённой структуры, потому что именно на такой структуре их дообучали. Маркер в первом сообщении пользователя - та же идея, применённая к пользовательским репликам.
  • Промпт с тегом <thinking> у Anthropic. Просьба к Claude использовать теги <thinking> работает, потому что CoT в форме XML-тегов массово присутствовал в обучающих данных. Это не детерминированный control-токен, но пример ровно той же "заученной структуры".
  • Маркеры обусловленности в генераторах изображений. Соглашения о негативных промптах и тегах качества в Stable Diffusion появились из структуры обучающих данных, а не как специально спроектированные элементы управления.

Связанные страницы