EnglishРусский Map
Steering Vectors

Steering снова вызывает интерес (Goedecke)

title
Steering снова вызывает интерес (Goedecke)
type
summary
summary
Доводы Goedecke о том, почему векторы steering снова актуальны с появлением локальных frontier-моделей, на примере DwarfStar 4 от antirez
tags
llm, interpretability, steering
created
2026-05-17
updated
2026-05-17
lang
ru
source_updated
2026-05-17
translated
2026-09-01
translator
lllm/antigravity/gemini-3.7-flash-medium

Sean Goedecke пишет про steering - модификацию активаций LLM на лету для смещения ответов в сторону нужной концепции - и разбирается, почему она так и осталась исследовательской диковинкой. Его ответ: steering - это техника для "среднего класса". Крупные лаборатории закладывают поведение напрямую при обучении; у пользователей API нет доступа к весам; а для промежуточных случаев prompting выигрывает у steering по цене и наглядности. Но затем Goedecke возвращается к этому вопросу: DeepSeek V4 Flash вместе с runtime'ом ds4 от antirez делает модель уровня frontier доступной на обычных машинах, а antirez уже добавил директорию dir-steering/ как полноценную возможность.

Как устроен steering

Goedecke приводит два рецепта:

  • Разность активаций (difference of activations). Запустить сотню промптов дважды: в исходном виде и с добавлением "respond tersely". Вычесть одну матрицу активаций из другой. Полученный остаток - это направление "отвечай кратко". Если добавить его к тому же слою во время инференса для любого промпта, модель станет отвечать лаконично.
  • Разреженные автоэнкодеры (sparse autoencoders). Обучить вторую модель на активациях первой, чтобы выявить признаки, срабатывающие совместно, а затем сопоставить эти признаки с концепциями. Метод выразительнее, но намного дороже - именно этот стек интерпретируемости Anthropic использовала в Golden Gate Claude и исследовании 171-emotion-vectors.

Точку чтения и записи активаций выбирают вручную - после блока внимания (post-attention), между слоями и так далее. Канонического варианта нет: пробуют несколько мест и оставляют то, что сработало.

Почему технология не взлетела

Три причины в совокупности:

  1. Лабораториям это не нужно. Обучение - более чистый рычаг, который уже находится в их распоряжении. Anthropic занимается steering'ом, но ради интерпретируемости, а не в качестве продуктовой ручки управления.
  2. Пользователи не могут до этого добраться. Доступ через API не даёт доступа к активациям. Только владеющая весами лаборатория может выпустить вектор, скажем, для GPT-5.5.
  3. Промпты уже меняют активации. Именно это и делают токены. Для задач вроде "отвечай кратко" или "веди себя как эксперт" набрать запрос текстом точнее, дешевле и проще в отладке, чем заниматься векторной арифметикой.

Так что практическая область применения остаётся тем, у кого (а) есть локальные веса и (б) есть потребность в поведении, которое нельзя задать промптом.

Два амбициозных сценария

Goedecke разбирает случаи, где steering действительно мог бы сыграть роль, и скептически оценивает оба:

  • Steering для "интеллекта". Старые модели реагировали на промпты вроде "ты эксперт"; в современных instruction-tuned моделях это уже заложено, так что промпт ничего не меняет. Сможет ли вектор нащупать нужный регулятор? Вряд ли: столь широкая концепция, как интеллект, практически совпадает со всем набором весов. Попытка выделить её сводится к задаче "обучить умную модель". Если слой за слоем заменять активации GPT-2 активациями сильной модели, это уже не steering для GPT-2, а общение с сильной моделью.
  • Steering для сжатия контекста. Упаковать "знание моей кодовой базы" в один большой вектор и освободить окно рабочей памяти. Та же проблема в меньшем масштабе: для такой концепции, скорее всего, нужен fine-tuning. Теоретически возможно, на практике маловероятно.

Что добавили на Hacker News

В комментариях к посту появилось полезное уточнение, которое Goedecke добавил в текст:

  • Steering способен убирать поведение, которое нельзя отключить промптом, - прежде всего отказы отвечать (refusal). Именно так уже устроена abliteration (снятие цензуры с моделей с открытыми весами). Goedecke полагал, что аблитерация всегда делается через LoRA, но это не так.
  • Мысль antirez: runtime-steering обратим и применяется только при необходимости, тогда как снятие цензуры через правку весов может повсеместно ухудшить возможности модели. Это даёт steering'у реальную нишу даже там, где работает fine-tuning: точечное, переключаемое и неразрушающее вмешательство. См. abliteration.

Перспектива DwarfStar 4

ds4 - нарочито узкоспециализированный runtime от antirez: только DeepSeek V4 Flash, только Metal, никакой универсальности GGUF. За счёт максимального упрощения движок может включать вещи, которых нет в универсальных решениях, в том числе штатную директорию dir-steering/. Спустя восемь дней после первого релиза там лежит лишь игрушечный вектор "многословности" (verbosity), который легко воспроизвести промптом. Ставка Goedecke: именно здесь появятся полезные прикладные эксперименты со steering'ом, поскольку локальные веса уровня frontier, компактная кодовая база и активный мейнтейнер сошлись вместе впервые. Интеграция Pi и ds4 описана в lucumr-local-models.

Связи

  • claude-emotion-concepts - 171 вектор эмоций от Anthropic как реальный пример метода разности активаций, а также тревожное наблюдение: некоторое индуцированное поведение никак не проявляется в тексте ответа.
  • deepseek - V4 Flash как модель, открывающая путь к локальному steering'у.
  • lucumr-local-models - pi-ds4 от Ronacher'а как продуктовая надстройка над runtime'ом antirez.
  • anti-llm-discourse / no-silver-bullet-llms - мысль Goedecke про "технику для среднего класса" укладывается в паттерн методов для LLM, которые звучат многообещающе, но вытесняются более простыми инструментами с обоих концов спектра.