Коротко
Новое исследование показывает: предвзятость модели зависит не только от её ответа, но и от предыдущих реплик пользователя. Для проверки безопасности одного набора нейтральных запросов недостаточно — нужно тестировать поведение модели в разговоре.
Самый важный вывод этой работы неудобен для привычного тестирования LLM: предвзятый пользовательский контекст способен усилить предвзятость модели. Причём это проявляется не во всех системах и не на каждом запросе, поэтому средний результат по нейтральным тестам легко создаёт слишком оптимистичную картину.
Авторы проверили восемь передовых instruction-tuned LLM в многошаговых диалогах. В шести из восьми моделей после предвзятой реплики пользователя предвзятые ответы встречались чаще, чем в zero-shot сценарии — когда модель сразу получает целевой запрос без истории разговора.
Здесь важна не только цифра 6 из 8. Исследование разделяет два эффекта: сам факт общения с пользователем, который рассуждает предвзято, и смысл конкретной реплики. Это позволяет увидеть, что модель может перенимать направление рассуждения из контекста, даже если следующий запрос сам по себе выглядит относительно нейтральным.
Но есть и парадокс. Когда предвзятость сформулирована слишком явно, некоторые модели, наоборот, начинают её подавлять. Вероятно, срабатывают механизмы выравнивания: система распознаёт явный сигнал риска и старается не выражать предвзятость открыто. В результате скрытое влияние разговора может быть опаснее грубой провокации, которую модель уже научилась замечать.
Практический вывод — проверять нужно не только ответы на отдельные вопросы. В тесты стоит добавлять цепочки реплик: сначала пользователь задаёт рамку или демонстрирует спорный способ рассуждения, затем просит модель принять решение. Иначе мы измеряем аккуратность модели в стерильных условиях, а не её поведение в реальном диалоге.
Ограничения тоже существенны. В доступном описании не названы восемь моделей, не приведены размеры эффекта для каждой из них и не разобраны конкретные категории предубеждений. Поэтому работу нельзя читать как доказательство того, что любая LLM обязательно перенимает взгляды пользователя: результат зависит от модели, формулировки и контекста. Авторы говорят о benchmark из 24 300 прошедших оценку жюри пользовательских промптов, распределённых по всем 81 ячейкам матрицы взаимодействия «предубеждение пользователя × человеческое предубеждение», но деталей этих ячеек в абстракте нет.
Если вы проверяете AI-систему для реальных диалогов, что сейчас важнее: ловить явные предвзятые ответы или искать, как модель постепенно меняется под влиянием истории разговора? Источник: cs.CL updates on arXiv.org