• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Logan Voss / Unsplash

Модель видит испорченный контекст, но не предупреждает об ошибке

Sh0ny
Sh0ny
11 августа 2026
  1. Главная
  2. Блог
  3. Модель видит испорченный контекст, но не предупреждает об ошибке
1 мин чтения

Коротко

Исследование показывает неприятный разрыв между тем, что можно обнаружить внутри языковой модели, и её способностью предсказать правильность ответа. Для мониторинга это означает: одной уверенности модели мало, но и внутренний сигнал нельзя подключить без учёта конкретной модели и типа ошибки.

Проблема мониторинга AI оказалась сложнее, чем кажется: модель может «знать», что контекст испорчен, но это почти не помогает понять, ошибётся ли она в финальном ответе.

Исследователи проверили это на цепочках многошаговой арифметики. Линейные probes почти идеально обнаруживали повреждение контекста, однако найденный сигнал не позволял надёжно отличить правильный результат от неправильного. Причём это наблюдение распространилось на разные семейства моделей, включая reasoning models.

Есть и более неприятная деталь. Когда модели заставляли выдавать уверенность в структурированном формате, ответы фактически сводились к двум значениям, а доля ошибок у них оставалась неразличимой. Даже длительное сохранение сигнала через несколько шагов не помогло предсказывать итог — предварительная гипотеза persistence beats peak не подтвердилась.

Практический вывод не в том, что внутренние probes бесполезны. Они могут дополнять обычную словесную уверенность модели, но их нельзя превращать в универсальную кнопку «остановить ошибку». В тестах стратегия branch-and-pick давала положительный результат для разных моделей и не ломала корректные цепочки на Llama-3.1-8B: четыре исправила и ни одну не испортила. А reprompt и replace-prior разрушали правильные цепочки примерно с той же частотой, с какой спасали неправильные.

Ограничение здесь принципиальное: универсального вмешательства не найдено. Эффект сильно зависит от модели и типа ошибки, а сам факт обнаружения повреждённого контекста ещё не означает, что модель выдаст неверный ответ. Поэтому рабочая архитектура мониторинга должна выбирать реакцию по двум параметрам — какая модель работает и какая именно ошибка обнаружена.

Если бы вы внедряли такой мониторинг сегодня, чему бы доверили право остановить ответ: уверенности модели, внутреннему probe-сигналу или их связке? Источник: cs.AI updates on arXiv.org

новостиaillmбезопасность
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​