Коротко
Новое исследование показывает: высокая уверенность модели не всегда означает хрупкое рассуждение, которое легко исправить повторной проверкой. Для практических систем это важный сигнал — self-critique может сделать ответ устойчивее, но не обязательно правильнее.
Самая неприятная ошибка языковой модели — не та, в которой она сомневается. Исследование на arXiv показывает, что некоторые неверные ответы остаются уверенными и стабильными даже после небольших изменений запроса.
Это меняет привычную логику самопроверки. Если модель несколько раз пересмотрела ответ и сохранила ту же уверенность, это ещё не доказательство, что она нашла истину. Возможно, она просто закрепилась в неправильном состоянии.
Авторы проверяли это на наборе бинарных фактических вопросов из разных областей. Один тест смотрел на изменения уверенности и число самоуверенных ошибок при принудительном выборе ответа. Другой измерял, насколько меняются внутренние состояния модели.
Получилась любопытная картина. Abstention-aware self-critique — самокритика с возможностью воздержаться от ответа — действительно помогала снижать потери в тех областях, где аудит находил проблемы с уверенностью. Но прямые базовые методы с известными метками оценивали этот эффект сильнее. Иными словами, самопроверка полезна, но это не замена нормальной калибровке на размеченных данных.
Есть и более неожиданный результат: в трёх open-weight моделях self-critical prompting последовательно снижал чувствительность скрытых состояний на разных слоях. Это похоже не просто на изменение формулировки финального ответа, а на локальную стабилизацию работы модели под воздействием промпта.
Но здесь и находится главный риск. Ошибки, которые аудит помечал как самоуверенные, не оказались явно более чувствительными к небольшим возмущениям, чем уверенно правильные ответы. Значит, «потрясти» модель дополнительным вопросом может быть недостаточно: часть неправильных ответов стабильна именно потому, что модель неправильно откалибрована, а не потому, что её рассуждение хрупкое.
Ограничения работы тоже важны: исследование опирается на бинарный фактический аудит, рассматривает три open-weight модели и не утверждает, что локальная стабилизация равна хорошей калибровке. Поэтому в прикладной системе я бы не считал повторную проверку самостоятельной гарантией качества. Для важных ответов нужны внешняя верификация, возможность отказаться от ответа и метрики, проверенные на размеченных примерах.
Если ваша система уже использует self-critique, она измеряет, стало ли меньше ошибок, или только то, насколько уверенно модель повторяет собственный ответ?
Источник: cs.AI updates on arXiv.org