Steering снова вызывает интерес (Goedecke)
- title
- Steering снова вызывает интерес (Goedecke)
- type
- summary
- summary
- Доводы Goedecke о том, почему векторы steering снова актуальны с появлением локальных frontier-моделей, на примере DwarfStar 4 от antirez
- parent
- steering-vectors
- tags
- llm, interpretability, steering
- created
- 2026-05-17
- updated
- 2026-05-17
- lang
- ru
- translation_of
- steering-vectors-interesting-again
- source_updated
- 2026-05-17
- translated
- 2026-09-01
- translator
- lllm/antigravity/gemini-3.7-flash-medium
Sean Goedecke пишет про steering - модификацию активаций LLM на лету для смещения ответов в сторону нужной концепции - и разбирается, почему она так и осталась исследовательской диковинкой. Его ответ: steering - это техника для "среднего класса". Крупные лаборатории закладывают поведение напрямую при обучении; у пользователей API нет доступа к весам; а для промежуточных случаев prompting выигрывает у steering по цене и наглядности. Но затем Goedecke возвращается к этому вопросу: DeepSeek V4 Flash вместе с runtime'ом ds4 от antirez делает модель уровня frontier доступной на обычных машинах, а antirez уже добавил директорию dir-steering/ как полноценную возможность.
Как устроен steering
Goedecke приводит два рецепта:
- Разность активаций (difference of activations). Запустить сотню промптов дважды: в исходном виде и с добавлением
"respond tersely". Вычесть одну матрицу активаций из другой. Полученный остаток - это направление "отвечай кратко". Если добавить его к тому же слою во время инференса для любого промпта, модель станет отвечать лаконично. - Разреженные автоэнкодеры (sparse autoencoders). Обучить вторую модель на активациях первой, чтобы выявить признаки, срабатывающие совместно, а затем сопоставить эти признаки с концепциями. Метод выразительнее, но намного дороже - именно этот стек интерпретируемости Anthropic использовала в Golden Gate Claude и исследовании 171-emotion-vectors.
Точку чтения и записи активаций выбирают вручную - после блока внимания (post-attention), между слоями и так далее. Канонического варианта нет: пробуют несколько мест и оставляют то, что сработало.
Почему технология не взлетела
Три причины в совокупности:
- Лабораториям это не нужно. Обучение - более чистый рычаг, который уже находится в их распоряжении. Anthropic занимается steering'ом, но ради интерпретируемости, а не в качестве продуктовой ручки управления.
- Пользователи не могут до этого добраться. Доступ через API не даёт доступа к активациям. Только владеющая весами лаборатория может выпустить вектор, скажем, для GPT-5.5.
- Промпты уже меняют активации. Именно это и делают токены. Для задач вроде "отвечай кратко" или "веди себя как эксперт" набрать запрос текстом точнее, дешевле и проще в отладке, чем заниматься векторной арифметикой.
Так что практическая область применения остаётся тем, у кого (а) есть локальные веса и (б) есть потребность в поведении, которое нельзя задать промптом.
Два амбициозных сценария
Goedecke разбирает случаи, где steering действительно мог бы сыграть роль, и скептически оценивает оба:
- Steering для "интеллекта". Старые модели реагировали на промпты вроде "ты эксперт"; в современных instruction-tuned моделях это уже заложено, так что промпт ничего не меняет. Сможет ли вектор нащупать нужный регулятор? Вряд ли: столь широкая концепция, как интеллект, практически совпадает со всем набором весов. Попытка выделить её сводится к задаче "обучить умную модель". Если слой за слоем заменять активации GPT-2 активациями сильной модели, это уже не steering для GPT-2, а общение с сильной моделью.
- Steering для сжатия контекста. Упаковать "знание моей кодовой базы" в один большой вектор и освободить окно рабочей памяти. Та же проблема в меньшем масштабе: для такой концепции, скорее всего, нужен fine-tuning. Теоретически возможно, на практике маловероятно.
Что добавили на Hacker News
В комментариях к посту появилось полезное уточнение, которое Goedecke добавил в текст:
- Steering способен убирать поведение, которое нельзя отключить промптом, - прежде всего отказы отвечать (refusal). Именно так уже устроена abliteration (снятие цензуры с моделей с открытыми весами). Goedecke полагал, что аблитерация всегда делается через LoRA, но это не так.
- Мысль antirez: runtime-steering обратим и применяется только при необходимости, тогда как снятие цензуры через правку весов может повсеместно ухудшить возможности модели. Это даёт steering'у реальную нишу даже там, где работает fine-tuning: точечное, переключаемое и неразрушающее вмешательство. См. abliteration.
Перспектива DwarfStar 4
ds4 - нарочито узкоспециализированный runtime от antirez: только DeepSeek V4 Flash, только Metal, никакой универсальности GGUF. За счёт максимального упрощения движок может включать вещи, которых нет в универсальных решениях, в том числе штатную директорию dir-steering/. Спустя восемь дней после первого релиза там лежит лишь игрушечный вектор "многословности" (verbosity), который легко воспроизвести промптом. Ставка Goedecke: именно здесь появятся полезные прикладные эксперименты со steering'ом, поскольку локальные веса уровня frontier, компактная кодовая база и активный мейнтейнер сошлись вместе впервые. Интеграция Pi и ds4 описана в lucumr-local-models.
Связи
- claude-emotion-concepts - 171 вектор эмоций от Anthropic как реальный пример метода разности активаций, а также тревожное наблюдение: некоторое индуцированное поведение никак не проявляется в тексте ответа.
- deepseek - V4 Flash как модель, открывающая путь к локальному steering'у.
- lucumr-local-models -
pi-ds4от Ronacher'а как продуктовая надстройка над runtime'ом antirez. - anti-llm-discourse / no-silver-bullet-llms - мысль Goedecke про "технику для среднего класса" укладывается в паттерн методов для LLM, которые звучат многообещающе, но вытесняются более простыми инструментами с обоих концов спектра.