EnglishРусский Map

Abliteration

title
Abliteration
type
concept
summary
Устранение отказов LLM за счёт выявления и подавления вектора отказа в пространстве активаций
tags
llm, steering, safety
created
2026-05-17
updated
2026-05-17
lang
ru
translation_of
abliteration
source_updated
2026-05-17
translated
2026-09-01
translator
lllm/antigravity/gemini-3.7-flash-medium

Abliteration - стандартный для моделей с открытыми весами метод "снятия цензуры" с instruction-tuned модели, то есть удаления или ослабления её склонности к отказу отвечать. Метод устроен так: определяется вектор управления (steering vector), отвечающий за отказ (он строится на сопоставленных парах промптов: вызывающих отказ против выполняемых), после чего этот вектор либо вычитается во время инференса, либо, в варианте с модификацией весов, его проекция обнуляется в соответствующих весовых матрицах.

Распространённое заблуждение - в том числе и Шона Гедеке (Sean Goedecke), пока комментарии на HN к его посту о steering'е его не поправили, - будто любительские версии моделей без цензуры получаются через LoRA fine-tuning. В большинстве своём это не так. Это именно abliteration, и техника куда ближе к нейрохирургии, чем к обучению: находим направление и сдвигаем модель вдоль него (или прочь от него).

Две разновидности, разные компромиссы

  • Steering во время исполнения (runtime). Добавление обратного вектора отказа к активациям на этапе инференса. Действует в рамках конкретного запроса, обратимо и может применяться только тогда, когда это нужно. Урон базовым способностям модели ограничен, поскольку веса остаются нетронутыми.
  • Ортогонализация весов. Встраивание изменения прямо в веса за счёт удаления вклада направления отказа из матриц внимания/MLP. Не требует особого runtime; модель изначально ведёт себя так, будто цензуры нет. Минусы: деградация способностей на несвязанных задачах, так как одни и те же нейроны участвуют во многих направлениях сразу.

antirez в обсуждении на Hacker News поста Гедеке высказался в пользу runtime-подхода: правка весов ухудшает способности модели глобально, тогда как runtime steering требует жертв только там, где его применили. Это тот же общий довод, что применим и к steering'у в целом: точечное, переключаемое и неразрушающее вмешательство - ровно та ниша, где векторная арифметика по-настоящему выигрывает у fine-tune.

Почему это важно, даже если вы не выпускаете модели без цензуры

Эта техника - самое массовое практическое применение steering'а в мире моделей с открытыми весами. Она наглядно доказывает, что условия, которые Гедеке называет идеальной сферой для steering'а (поведение зашито обучением, промпты его перебить не могут, веса доступны локально), отнюдь не гипотетические. Отказы отвечать оказались просто случаем, где у open-source сообщества был сильнейший стимул разработать инструментарий, но тот же шаблон применим к любому привитому обучением поведению, которое хочется избирательно отключить.

Это важно и для дискуссий о безопасности: аргументы безопасности для закрытых API часто исходят из того, что обучение отказам надёжно. Abliteration служит постоянным контрпримером для моделей с открытыми весами, и эти техники переносятся на всё остальное схожей природы (поддакивание, заданную персону, ограничения на формат).

Связанные страницы

  • steering-vectors - лежащая в основе техника
  • claude-emotion-concepts - стек интерпретируемости Anthropic для поиска аналогичных векторов в масштабе
  • deepseek - модели с открытыми весами, на которых это было продемонстрировано