• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: I'M ZION / Unsplash

AI-судья стал реже пропускать сломанных агентов

Sh0ny
Sh0ny
17 августа 2026
  1. Главная
  2. Блог
  3. AI-судья стал реже пропускать сломанных агентов
1 мин чтения

Коротко

RubricForge не делает автоматическую оценку агентов точнее по всем метрикам, но заметно снижает число опасных ложных «успехов». Разбираем, почему для продакшена это может быть важнее общего совпадения с эталоном.

Главная проблема автоматического судьи для AI-агентов — не в том, что он иногда ругается зря. Хуже, когда он принимает провальный сценарий за успешный: сломанный агент проходит проверку и отправляется дальше.

RubricForge предлагает решать это не дополнительным обучением модели, а текстом рубрики. Система берёт небольшую выборку траекторий с известным истинным результатом, через итеративную проверку улучшает критерии оценки, а затем фиксирует готовую рубрику.

После этого судья проверяет новые траектории одним вызовом модели и без доступа к окружению. Важная деталь: результатом становится обычный текст с понятными критериями. Можно увидеть, почему агент признан успешным или провалившимся, а не доверять непрозрачной настройке весов.

Именно здесь находится практическая ценность подхода. На tau-bench RubricForge снизил долю ложных проходов примерно в полтора раза: с 0.173 до 0.115. Для оценки агентов это важнее, чем просто высокий процент совпадений: ложный провал обычно означает повторную попытку, а ложный успех может отправить неисправный сценарий в эксплуатацию.

Но это не универсальная победа. Преимущество над обычным G-Eval по общей согласованности не оказалось статистически значимым, а по калибровке абсолютных оценок generic-судья оказался немного лучше. Результаты получены на tau-bench и WebShop, на сравнительно небольших наборах размеченных траекторий; в эксперименте одна и та же замороженная 7B-модель выступала и агентом, и судьёй. Кроме того, после построения рубрика уже не обращается к окружению — её качество зависит от того, насколько хорошо была размечена исходная выборка.

Поэтому RubricForge стоит воспринимать не как «более умную модель-судью», а как способ настроить проверку под самый дорогой тип ошибки. Для команды это вполне конкретный выбор: оптимизировать среднюю точность или сначала научиться не пропускать провалы.

Что для вашего агента опаснее: лишняя повторная проверка из-за ложного провала или один незамеченный успешным тестом сбой? Источник: cs.AI updates on arXiv.org

новостиaiагентыllm
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​