Коротко
Исследование показывает: внутренние представления разных LLM действительно могут быть похожи, но перенос управления поведением работает лишь после определённого масштаба. Для небольших моделей это важное предупреждение: методы интерпретируемости нельзя автоматически копировать с крупных систем.
Перенос управления из одной LLM в другую выглядит рабочим только после определённого порога размера. В исследовании этот порог оказался примерно около 1,7 млрд параметров — ниже него сходство моделей резко теряет практический смысл.
Авторы сравнили пять open-weight моделей двух архитектурных направлений и трёх масштабов. Для каждой обучили Sparse Autoencoder, выделили направления 15 семантических понятий и проверили все 20 направленных пар моделей.
У моделей от 1,7 млрд параметров и выше от 47 до 49% пар признаков показали заметное выравнивание. Но интереснее другое: в тесте управления поведением векторы, перенесённые из другой модели, получили 71% побед против 68% у нативных векторов той же модели.
Это не означает, что существует один универсальный рычаг для всех LLM. Один общий вектор сработал в четырёх из пяти моделей и показал 67,3% побед. Зато сам факт важен: для части моделей можно управлять поведением без дообучения именно потому, что их внутреннее пространство оказалось функционально совместимым.
Практический вывод для разработчиков инструментов интерпретируемости неприятный: результат, полученный на модели уровня 7B, нельзя без проверки переносить на маленькую модель. Исследование охватывает всего пять моделей, а для одной из них генерация была нестабильной; перенос также заметно ухудшался у моделей меньше 1,7 млрд параметров. Поэтому обнаруженный порог пока стоит воспринимать как сильный сигнал, а не как универсальный закон для всех архитектур и задач.
Если вы строите инструменты управления LLM, что для вас важнее: один переносимый механизм для разных моделей или отдельная проверка каждой модели перед использованием?
Источник: cs.CL updates on arXiv.org