Коротко
Activation steering позволяет менять поведение языковой модели без переобучения, но затрагивает и другие свойства. Исследование показывает: эти побочные эффекты не случайны — их можно оценить до вмешательства и заранее провести аудит безопасности.
Управлять поведением модели одной «ручкой» не получится: добавление направления в скрытые активации меняет не только целевую характеристику. Хорошая новость в том, что побочные эффекты часто возникают по закономерностям, а значит, их можно искать до запуска steering, а не после неприятного инцидента.
Activation steering — это способ изменить поведение уже готовой языковой модели без её переобучения. Исследователи проверили, как такая настройка влияет на 67 разных поведений в трёх моделях с открытыми весами, и составили матрицу перекрёстных эффектов.
Картина оказалась сложнее, чем «похожее поведение влияет на похожее». Эффекты распространены, имеют структуру и часто асимметричны: изменение A может заметно повлиять на B, тогда как изменение B почти не затронет A.
Самый полезный результат работы не в том, что побочные эффекты обнаружили. Важно, что их в значительной степени удалось предсказать заранее.
Причём разные свойства предсказываются по-разному. Масштаб побочного эффекта в основном зависит от целевого поведения, а его направление — например, усилится или ослабнет другая характеристика — можно оценивать по представлениям модели до steering. Такой прогноз оказался существенно точнее простых базовых методов.
Это меняет сам процесс внедрения. Перед применением steering можно построить карту рисков: какие поведения затронет вмешательство, в какую сторону и насколько сильно. То есть настройка модели превращается из ручного эксперимента в процедуру предварительного аудита.
Результат не означает, что поведение модели теперь можно просчитать безошибочно. Исследование охватывает 67 поведений и три open-weight модели, а сами авторы отмечают, что взаимодействия между свойствами нельзя объяснить существующими эвристиками на основе простого сходства. Кроме того, в abstract не приведены абсолютные значения точности прогноза, поэтому «предсказуемо» здесь не равно «гарантированно».
Но направление выглядит важным: побочные эффекты steering — не хаотичный шум, который остаётся только ловить постфактум. Их можно сделать частью проверки перед развёртыванием, особенно если изменение одного поведения способно повлиять на безопасность или надёжность модели.
Если бы вы добавляли steering в рабочую систему, какой побочный эффект проверили бы первым — и хватило бы вам прогноза, заметно лучшего простого baseline? Источник: cs.AI updates on arXiv.org