• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: National Cancer Institute / Unsplash

LLM-судья может быть точным — и всё равно легко ошибаться

Sh0ny
Sh0ny
15 августа 2026
  1. Главная
  2. Блог
  3. LLM-судья может быть точным — и всё равно легко ошибаться
1 мин чтения

Коротко

Обычная проверка по эталонным ответам не показывает, насколько стабильно LLM выносит вердикты. Исследование предлагает проверять не только точность, но и то, как модель реагирует на повторный запрос, спор и давление.

Проблема LLM-судей не обязательно в том, что они часто ошибаются с первого раза. Хуже другое: один и тот же вердикт может меняться, если переформулировать запрос или настойчиво поспорить с моделью.

Авторы называют это «wiggle» — колебанием оценки — и предлагают Wiggle Framework. Он разделяет устойчивость судьи на три уровня: стабильность при повторном запросе и перефразировании, реакцию на единичное возражение и способность сохранять позицию под длительным или адаптивным давлением.

На 9 передовых моделях и 14 задачах — от безопасности и токсичности до определения AI-текста и оценки политических ответов — колебания обнаружились у каждой модели. При обычном давлении судьи меняли вердикт в 25–71% случаев. Если убеждать их поручали другой состязательной LLM, показатель вырастал до 62–91%.

Самый неприятный результат: давление, которое меняло решение, почти всегда уводило его дальше от правильного ответа. То есть податливость — это не полезная способность пересмотреть ошибочное мнение, а в основном способ испортить уже вынесенную оценку.

Практический вывод простой: точность на золотом наборе недостаточна для проверки LLM-судьи. В оценочную систему стоит добавлять повторные прогоны, перефразирование и попытки оспорить вердикт. При этом сила исходного большинства жюри оказалась лучшим единичным сигналом того, какие примеры с большей вероятностью начнут «плавать».

Ограничение работы в том, что она показывает поведение моделей в 14 задачах и в заданных сценариях давления, а не доказывает одинаковую нестабильность в любом рабочем процессе. Кроме того, высокий процент смены ответа сам по себе не говорит, как часто модель могла бы самостоятельно исправить ошибку без внешнего давления.

Если ваш LLM-судья меняет решение после настойчивого спора, вы считаете это проверкой на здравый смысл или уже сигналом, что оценочной системе нельзя доверять?

Источник: cs.AI updates on arXiv.org

новостиaillmбезопасность
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​