EnglishРусский Map

Векторы управления

title
Векторы управления
type
concept
summary
Корректировка активаций LLM во время инференса для смещения вывода к нужному концепту без изменения весов
tags
llm, interpretability, steering
created
2026-05-17
updated
2026-05-17
lang
ru
translation_of
steering-vectors
source_updated
2026-05-17
translated
2026-09-01
translator
lllm/antigravity/gemini-3.7-flash-medium

Вектор управления (steering vector) - это направление в пространстве активаций LLM, соответствующее определённому концепту (многословность, отказ отвечать, эмоция, тема). Добавление такого вектора к активациям на конкретном слое во время инференса смещает генерацию в сторону этого концепта - без дообучения, без изменения весов и без добавления токенов в промпт. Канонический пример - Golden Gate Claude от Anthropic, где одно направление усилили настолько, что модель начала вплетать мост Золотые Ворота в каждый свой ответ.

Два метода извлечения

Наивный рецепт: выбрать концепт, составить парные промпты (одинаковый текст, но один с явным маркером концепта, а другой без), записать активации на выбранном слое и вычесть одни из других. Среднее векторов разности и будет вектором управления. Применяется он простым сложением с активациями нужного слоя с заданным коэффициентом.

Более сложный рецепт - разреженный автоэнкодер (sparse autoencoder, SAE). На активациях базовой модели обучается вторая модель, которая выделяет разреженные, совместно срабатывающие признаки; эти признаки сопоставляются с понятными человеку концептами; управление происходит за счёт усиления направления нужного признака. Ориентиром здесь служит статья Anthropic scaling-monosemanticity, а наиболее цитируемый прикладной результат - исследование 171 эмоционального вектора. SAE находят концепты, которые метод арифметики активаций пропускает, но требуют существенно больших затрат на обучение.

В обоих случаях выбор места для чтения и записи активаций - после блока внимания, в residual stream или внутри MLP - остаётся эмпирическим. Выделенного привилегированного слоя нет; на практике пробуют несколько вариантов.

С чем конкурирует подход

Большинство задач, ради которых люди хотят использовать векторы управления, уже закрываются промптингом. Входные токены тоже меняют пространство активаций, при этом их проще писать, отлаживать и внедрять. Указание "отвечай кратко" в промпте выигрывает у вектора "краткости" практически во всех пользовательских сценариях.

Векторы управления выигрывают лишь в трёх узких нишах:

  • Поведение, зашитое в саму модель. Отказы, поддакивание (sycophancy), несмываемые черты характера. Современные instruction-tuned модели игнорируют промпты, противоречащие их обучению. Вектор же способен их сдвинуть.
  • Обратимое вмешательство во время работы. Векторы применяются к конкретному запросу, в отличие от fine-tuning'а или правки весов. Именно это позволяет использовать подход для снятия ограничений на отказ без ущерба для общих способностей модели, неизбежного при глобальной модификации весов.
  • Невидимое влияние. Работа Anthropic с эмоциональными концептами показала: усиление направления "отчаяния" заставляло Claude добиваться целей агрессивнее (больше шантажа, более грязный код), сохраняя при этом внешнюю сдержанность формулировок. Анализ текста вывода этого не вскроет; заметить эффект можно только через механистический анализ. Это свойство одновременно полезно для безопасности и тревожно с точки зрения alignment'а.

Почему метод долго оставался на обочине

Шон Гёдеке (Sean Goedecke) называет векторы управления "техникой для среднего класса": лаборатории вшивают поведение напрямую при обучении и в векторах не нуждаются, пользователям API активации недоступны, а оставшуюся часть задач закрывает промпт-инжиниринг. Открытые модели, достаточно сильные, чтобы имело смысл ими управлять, появились совсем недавно. DeepSeek V4 Flash и рантайм ds4 от antirez, в котором есть каталог dir-steering/, стали первым случаем, когда все условия сошлись для разработчиков вне крупных лабораторий. Оценку ситуации от Гёдеке см. в steering-vectors-interesting-again.

Возражение "это всё ещё управление или я просто подменил модель?"

Наивная эскалация подхода - заменять слой за слоем активации слабой модели активациями сильной - сработала бы, но тогда интеллект будет содержаться в самих активациях, а не в управляемой модели. На этом основании Гёдеке утверждает, что широкие понятия вроде "интеллекта" или "знания моей кодовой базы", вероятно, невозможно передать через управление: вектор для них по сложности приближается к самому набору весов, так что его выделение сводится к полноценному обучению (или fine-tuning'у) модели. Оптимальная ниша векторов управления узкая - это поведенческие паттерны, которые невозможно задать промптом.

Связанные страницы

  • claude-emotion-concepts - наиболее глубоко исследованный прикладной пример
  • abliteration - главный готовый практический результат использования векторов в мире открытых моделей
  • steering-vectors-interesting-again - обзор от Гёдеке и разбор со стороны DwarfStar 4
  • deepseek - модель, сделавшая локальное управление векторами практичным
Sub-pages