Коротко
Одна модель плохо замечает ошибки в длинных рассуждениях, даже если это frontier-модель. Reasoning Jury предлагает вместо неё несколько open-weight моделей с модератором — и заявляет более высокую точность при 8–15% от стоимости обычной проверки.
Главный эффект Reasoning Jury не в том, что моделей стало больше. Он в том, что проверку рассуждений превратили из одиночного вердикта в обсуждение, где модели могут критиковать и пересматривать решения друг друга.
Это важно для задач, где ответ сам по себе ещё ничего не доказывает. Нужно понять, где именно модель ошиблась в длинной цепочке рассуждений, насколько серьёзна ошибка и можно ли использовать этот разбор для обучения.
В системе несколько LLM сначала выносят собственные вердикты. Затем модератор организует обсуждение: жюри сопоставляет оценки, участники критикуют аргументы друг друга, а после этого могут изменить первоначальный голос. Итогом становится согласованное решение о дефекте и его тяжести.
Практическое следствие — проверяющий не обязан быть самой дорогой моделью в системе. В описанных экспериментах жюри из open-weight моделей, включая пример с gpt-oss-120b, точнее находило ошибки в рассуждениях, чем opus-4.6, sonnet-4.6 и gemini-3.1-pro. Такой подход также может обходить ограничения на использование frontier-моделей в онлайн-обучении.
Цена этой схемы — дополнительные вызовы моделей и сама процедура обсуждения. Но авторы утверждают, что суммарная стоимость вердиктов, делиберации и сведения результатов составляет лишь 8–15% стоимости проверки одной frontier-моделью. Это уже не просто способ повысить качество оценки, а потенциально более дешёвая архитектура для контроля reasoning-моделей.
Ограничения тоже существенные: в доступном описании нет деталей о составе жюри, конкретных бенчмарках, абсолютных значениях точности и том, насколько хорошо метод переносится на другие задачи. Поэтому пока это сильный результат заявленного эксперимента, а не доказательство того, что любое собрание моделей автоматически лучше хорошего одиночного судьи.
Если бы вам пришлось выбирать для проверки AI-ответов, что важнее: одна максимально мощная модель или несколько более доступных моделей с обязательным обсуждением? Источник: cs.AI updates on arXiv.org