• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: National Cancer Institute / Unsplash

Уверенная ошибка LLM может быть стабильной — и это опаснее

Sh0ny
Sh0ny
17 августа 2026
  1. Главная
  2. Блог
  3. Уверенная ошибка LLM может быть стабильной — и это опаснее
2 мин чтения

Коротко

Новое исследование показывает: высокая уверенность модели не всегда означает хрупкое рассуждение, которое легко исправить повторной проверкой. Для практических систем это важный сигнал — self-critique может сделать ответ устойчивее, но не обязательно правильнее.

Самая неприятная ошибка языковой модели — не та, в которой она сомневается. Исследование на arXiv показывает, что некоторые неверные ответы остаются уверенными и стабильными даже после небольших изменений запроса.

Это меняет привычную логику самопроверки. Если модель несколько раз пересмотрела ответ и сохранила ту же уверенность, это ещё не доказательство, что она нашла истину. Возможно, она просто закрепилась в неправильном состоянии.

Авторы проверяли это на наборе бинарных фактических вопросов из разных областей. Один тест смотрел на изменения уверенности и число самоуверенных ошибок при принудительном выборе ответа. Другой измерял, насколько меняются внутренние состояния модели.

Получилась любопытная картина. Abstention-aware self-critique — самокритика с возможностью воздержаться от ответа — действительно помогала снижать потери в тех областях, где аудит находил проблемы с уверенностью. Но прямые базовые методы с известными метками оценивали этот эффект сильнее. Иными словами, самопроверка полезна, но это не замена нормальной калибровке на размеченных данных.

Есть и более неожиданный результат: в трёх open-weight моделях self-critical prompting последовательно снижал чувствительность скрытых состояний на разных слоях. Это похоже не просто на изменение формулировки финального ответа, а на локальную стабилизацию работы модели под воздействием промпта.

Но здесь и находится главный риск. Ошибки, которые аудит помечал как самоуверенные, не оказались явно более чувствительными к небольшим возмущениям, чем уверенно правильные ответы. Значит, «потрясти» модель дополнительным вопросом может быть недостаточно: часть неправильных ответов стабильна именно потому, что модель неправильно откалибрована, а не потому, что её рассуждение хрупкое.

Ограничения работы тоже важны: исследование опирается на бинарный фактический аудит, рассматривает три open-weight модели и не утверждает, что локальная стабилизация равна хорошей калибровке. Поэтому в прикладной системе я бы не считал повторную проверку самостоятельной гарантией качества. Для важных ответов нужны внешняя верификация, возможность отказаться от ответа и метрики, проверенные на размеченных примерах.

Если ваша система уже использует self-critique, она измеряет, стало ли меньше ошибок, или только то, насколько уверенно модель повторяет собственный ответ?

Источник: cs.AI updates on arXiv.org

новостиaillmнейросети
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​