• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Google DeepMind / Unsplash

Почему «жюри» из LLM оказалось сильнее одной дорогой модели

Sh0ny
Sh0ny
15 августа 2026
  1. Главная
  2. Блог
  3. Почему «жюри» из LLM оказалось сильнее одной дорогой модели
1 мин чтения

Коротко

Одна модель плохо замечает ошибки в длинных рассуждениях, даже если это frontier-модель. Reasoning Jury предлагает вместо неё несколько open-weight моделей с модератором — и заявляет более высокую точность при 8–15% от стоимости обычной проверки.

Главный эффект Reasoning Jury не в том, что моделей стало больше. Он в том, что проверку рассуждений превратили из одиночного вердикта в обсуждение, где модели могут критиковать и пересматривать решения друг друга.

Это важно для задач, где ответ сам по себе ещё ничего не доказывает. Нужно понять, где именно модель ошиблась в длинной цепочке рассуждений, насколько серьёзна ошибка и можно ли использовать этот разбор для обучения.

В системе несколько LLM сначала выносят собственные вердикты. Затем модератор организует обсуждение: жюри сопоставляет оценки, участники критикуют аргументы друг друга, а после этого могут изменить первоначальный голос. Итогом становится согласованное решение о дефекте и его тяжести.

Практическое следствие — проверяющий не обязан быть самой дорогой моделью в системе. В описанных экспериментах жюри из open-weight моделей, включая пример с gpt-oss-120b, точнее находило ошибки в рассуждениях, чем opus-4.6, sonnet-4.6 и gemini-3.1-pro. Такой подход также может обходить ограничения на использование frontier-моделей в онлайн-обучении.

Цена этой схемы — дополнительные вызовы моделей и сама процедура обсуждения. Но авторы утверждают, что суммарная стоимость вердиктов, делиберации и сведения результатов составляет лишь 8–15% стоимости проверки одной frontier-моделью. Это уже не просто способ повысить качество оценки, а потенциально более дешёвая архитектура для контроля reasoning-моделей.

Ограничения тоже существенные: в доступном описании нет деталей о составе жюри, конкретных бенчмарках, абсолютных значениях точности и том, насколько хорошо метод переносится на другие задачи. Поэтому пока это сильный результат заявленного эксперимента, а не доказательство того, что любое собрание моделей автоматически лучше хорошего одиночного судьи.

Если бы вам пришлось выбирать для проверки AI-ответов, что важнее: одна максимально мощная модель или несколько более доступных моделей с обязательным обсуждением? Источник: cs.AI updates on arXiv.org

новостиaillmразработка
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​