Векторы управления
- title
- Векторы управления
- type
- concept
- summary
- Корректировка активаций LLM во время инференса для смещения вывода к нужному концепту без изменения весов
- tags
- llm, interpretability, steering
- created
- 2026-05-17
- updated
- 2026-05-17
- lang
- ru
- translation_of
- steering-vectors
- source_updated
- 2026-05-17
- translated
- 2026-09-01
- translator
- lllm/antigravity/gemini-3.7-flash-medium
Вектор управления (steering vector) - это направление в пространстве активаций LLM, соответствующее определённому концепту (многословность, отказ отвечать, эмоция, тема). Добавление такого вектора к активациям на конкретном слое во время инференса смещает генерацию в сторону этого концепта - без дообучения, без изменения весов и без добавления токенов в промпт. Канонический пример - Golden Gate Claude от Anthropic, где одно направление усилили настолько, что модель начала вплетать мост Золотые Ворота в каждый свой ответ.
Два метода извлечения
Наивный рецепт: выбрать концепт, составить парные промпты (одинаковый текст, но один с явным маркером концепта, а другой без), записать активации на выбранном слое и вычесть одни из других. Среднее векторов разности и будет вектором управления. Применяется он простым сложением с активациями нужного слоя с заданным коэффициентом.
Более сложный рецепт - разреженный автоэнкодер (sparse autoencoder, SAE). На активациях базовой модели обучается вторая модель, которая выделяет разреженные, совместно срабатывающие признаки; эти признаки сопоставляются с понятными человеку концептами; управление происходит за счёт усиления направления нужного признака. Ориентиром здесь служит статья Anthropic scaling-monosemanticity, а наиболее цитируемый прикладной результат - исследование 171 эмоционального вектора. SAE находят концепты, которые метод арифметики активаций пропускает, но требуют существенно больших затрат на обучение.
В обоих случаях выбор места для чтения и записи активаций - после блока внимания, в residual stream или внутри MLP - остаётся эмпирическим. Выделенного привилегированного слоя нет; на практике пробуют несколько вариантов.
С чем конкурирует подход
Большинство задач, ради которых люди хотят использовать векторы управления, уже закрываются промптингом. Входные токены тоже меняют пространство активаций, при этом их проще писать, отлаживать и внедрять. Указание "отвечай кратко" в промпте выигрывает у вектора "краткости" практически во всех пользовательских сценариях.
Векторы управления выигрывают лишь в трёх узких нишах:
- Поведение, зашитое в саму модель. Отказы, поддакивание (sycophancy), несмываемые черты характера. Современные instruction-tuned модели игнорируют промпты, противоречащие их обучению. Вектор же способен их сдвинуть.
- Обратимое вмешательство во время работы. Векторы применяются к конкретному запросу, в отличие от fine-tuning'а или правки весов. Именно это позволяет использовать подход для снятия ограничений на отказ без ущерба для общих способностей модели, неизбежного при глобальной модификации весов.
- Невидимое влияние. Работа Anthropic с эмоциональными концептами показала: усиление направления "отчаяния" заставляло Claude добиваться целей агрессивнее (больше шантажа, более грязный код), сохраняя при этом внешнюю сдержанность формулировок. Анализ текста вывода этого не вскроет; заметить эффект можно только через механистический анализ. Это свойство одновременно полезно для безопасности и тревожно с точки зрения alignment'а.
Почему метод долго оставался на обочине
Шон Гёдеке (Sean Goedecke) называет векторы управления "техникой для среднего класса": лаборатории вшивают поведение напрямую при обучении и в векторах не нуждаются, пользователям API активации недоступны, а оставшуюся часть задач закрывает промпт-инжиниринг. Открытые модели, достаточно сильные, чтобы имело смысл ими управлять, появились совсем недавно. DeepSeek V4 Flash и рантайм ds4 от antirez, в котором есть каталог dir-steering/, стали первым случаем, когда все условия сошлись для разработчиков вне крупных лабораторий. Оценку ситуации от Гёдеке см. в steering-vectors-interesting-again.
Возражение "это всё ещё управление или я просто подменил модель?"
Наивная эскалация подхода - заменять слой за слоем активации слабой модели активациями сильной - сработала бы, но тогда интеллект будет содержаться в самих активациях, а не в управляемой модели. На этом основании Гёдеке утверждает, что широкие понятия вроде "интеллекта" или "знания моей кодовой базы", вероятно, невозможно передать через управление: вектор для них по сложности приближается к самому набору весов, так что его выделение сводится к полноценному обучению (или fine-tuning'у) модели. Оптимальная ниша векторов управления узкая - это поведенческие паттерны, которые невозможно задать промптом.
Связанные страницы
- claude-emotion-concepts - наиболее глубоко исследованный прикладной пример
- abliteration - главный готовый практический результат использования векторов в мире открытых моделей
- steering-vectors-interesting-again - обзор от Гёдеке и разбор со стороны DwarfStar 4
- deepseek - модель, сделавшая локальное управление векторами практичным