Коротко
RubricForge не делает автоматическую оценку агентов точнее по всем метрикам, но заметно снижает число опасных ложных «успехов». Разбираем, почему для продакшена это может быть важнее общего совпадения с эталоном.
Главная проблема автоматического судьи для AI-агентов — не в том, что он иногда ругается зря. Хуже, когда он принимает провальный сценарий за успешный: сломанный агент проходит проверку и отправляется дальше.
RubricForge предлагает решать это не дополнительным обучением модели, а текстом рубрики. Система берёт небольшую выборку траекторий с известным истинным результатом, через итеративную проверку улучшает критерии оценки, а затем фиксирует готовую рубрику.
После этого судья проверяет новые траектории одним вызовом модели и без доступа к окружению. Важная деталь: результатом становится обычный текст с понятными критериями. Можно увидеть, почему агент признан успешным или провалившимся, а не доверять непрозрачной настройке весов.
Именно здесь находится практическая ценность подхода. На tau-bench RubricForge снизил долю ложных проходов примерно в полтора раза: с 0.173 до 0.115. Для оценки агентов это важнее, чем просто высокий процент совпадений: ложный провал обычно означает повторную попытку, а ложный успех может отправить неисправный сценарий в эксплуатацию.
Но это не универсальная победа. Преимущество над обычным G-Eval по общей согласованности не оказалось статистически значимым, а по калибровке абсолютных оценок generic-судья оказался немного лучше. Результаты получены на tau-bench и WebShop, на сравнительно небольших наборах размеченных траекторий; в эксперименте одна и та же замороженная 7B-модель выступала и агентом, и судьёй. Кроме того, после построения рубрика уже не обращается к окружению — её качество зависит от того, насколько хорошо была размечена исходная выборка.
Поэтому RubricForge стоит воспринимать не как «более умную модель-судью», а как способ настроить проверку под самый дорогой тип ошибки. Для команды это вполне конкретный выбор: оптимизировать среднюю точность или сначала научиться не пропускать провалы.
Что для вашего агента опаснее: лишняя повторная проверка из-за ложного провала или один незамеченный успешным тестом сбой? Источник: cs.AI updates on arXiv.org