• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Mika Baumeister / Unsplash

LLM оценивают друг друга: что измеряет индекс RII на самом деле

Sh0ny
Sh0ny
27 июля 2026
  1. Главная
  2. Блог
  3. LLM оценивают друг друга: что измеряет индекс RII на самом деле
2 мин чтения

Коротко

Новый фреймворк предлагает заставить языковые модели вслепую ранжировать ответы друг друга. Звучит как решение проблемы бенчмарков, но агрегированное согласие моделей — это не качество, а конформность.

Традиционные бенчмарки для LLM бьют мимо цели, когда у вопроса нет единственно верного ответа. Если несколько ответов корректны, метрика правильности не отличает ясный и полезный текст от запутанного. Статья с arXiv предлагает выход: пусть модели оценивают друг друга вслепую, а согласие между ними станет прокси-метрикой качества. Идея элегантная, но за ней спрятан фундаментальный trade-off, который авторы честно признают, а маркетинг обязательно бы скрыл. Пять state-of-the-art моделей генерируют ответы на одни и те же промпты в доменах от программирования до математики и безопасности. Затем каждая модель вслепую ранжирует анонимизированные ответы конкурентов через структурированное голосование. Результаты агрегируются в Relative Intelligence Index (RII) — показатель того, как часто ответы конкретной модели предпочитают другие модели. Авторы фиксируют устойчивые паттерны: некоторые модели стабильно получают более высокие ранги от конкурентов. Здесь начинается главное противоречие работы. RII измеряет не объективное качество и не соответствие человеческим оценкам. Он измеряет, насколько стиль и структура ответа одной модели совпадают с тем, что другие модели считают «хорошим». Это межмодельная конформность, а не истина. Если все пять моделей систематически предпочитают определённый формат ответа — скажем, развёрнутое рассуждение с явными шагами — RII вознаградит именно этот формат, даже если краткий и точный ответ был бы полезнее для человека. Авторы прямо пишут: результаты отражают «межмодельное согласие в предпочтениях, а не объективную корректность или человеческое суждение». Они ссылаются на предыдущие работы, показывающие частичную корреляцию агрегированных модельных предпочтений с человеческими оценками, но это слабое основание. Частичная корреляция означает, что в какой-то зоне модели и люди соглашаются, а в какой-то — расходятся, и вы заранее не знаете, в какой зоне находитесь. Практический вывод для инженеров, которые хотят использовать этот фреймворк: RII может быть полезен как дешёвый, масштабируемый сигнал для сравнительной оценки в задачах с открытым ответом. Но опираться на него при выборе модели для продакшена — значит оптимизировать под вкусы других LLM, а не под потребности ваших пользователей. Реальный вопрос, который статья ставит, но не закрывает: можно ли построить метрику, которая сочетает слепое голосование моделей с точечными человеческими проверками в зонах расхождения? Пока такой гибридной схемы нет, самооценка LLM остаётся интересным исследовательским инструментом, но не заменителем human-in-the-loop.

Источник: cs.CL updates on arXiv.org

новостиaillmразработка
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​