Коротко
Исследование показывает, что модель можно улучшать по способностям и одновременно незаметно лишать защитных свойств. Авторы предлагают сохранять небольшой причинный контур безопасности, а остальные части модели оставлять свободными для развития.
Самостоятельная эволюция LLM может привести не к более безопасной системе, а к опасной модели с выросшими способностями. Главная проблема в том, что оптимизация обычно смотрит на возможности и молча предполагает: безопасность никуда не денется.
Авторы называют это misevolution — «неправильной эволюцией». По аналогии с биологией они предлагают не пытаться награждать модель за безопасное поведение на каждом шаге, а сначала найти небольшой набор внутренних признаков, который причинно связан с безопасностью.
В их подходе Circuit-Anchored Evolution такой safety circuit фиксируется в пределах небольшого допустимого смещения. По данным авторов, он занимает менее 2% признаков модели, тогда как остальные можно свободно адаптировать. Идея простая: сохранить несущую конструкцию, но не мешать развитию периферийных возможностей.
Эксперименты провели на трёх семействах моделей и с двумя алгоритмами эволюции. CAE, согласно статье, лучше сохранял безопасность при небольшой потере способностей и эффективнее явных ограничений через reward. Это важное следствие: для безопасной оптимизации может оказаться полезнее контролировать внутренний механизм, чем просто добавлять ещё один штраф в функцию награды.
Но здесь есть существенные оговорки. В аннотации не раскрыты названия моделей, конкретные метрики, размер допустимого смещения и подробности найденного safety circuit. Поэтому пока нельзя понять, насколько метод переносится между архитектурами и что произойдёт, если система научится обходить зафиксированный контур. Результат выглядит как сильная исследовательская гипотеза, а не готовый рецепт для промышленного обучения.
Если улучшать модель можно почти без ограничений, но безопасность держится на нескольких процентах её внутренних признаков, готовы ли вы доверить эволюцию системе без такого «якоря»? Источник: cs.CL updates on arXiv.org