Коротко
Новый benchmark показывает границу prompt engineering: для привычных финансовых ролей он почти воспроизводит профессиональные критерии, а для специализированных — заметно проигрывает. Практический вывод: качество агента нужно проверять не только по заданию, но и по стандартам реальной рабочей роли.
Главная проблема оценки финансовых AI-агентов не в нехватке тестовых задач. Проблема в том, что хороший результат часто определяется негласными профессиональными стандартами, которых нет в самом промпте.
Именно на этом строится FinProBench — benchmark для финансовых задач — и метод Role-Grounded Rubric Construction (RGRC). Вместо того чтобы выводить критерии оценки из формулировки задания или ответа модели, авторы сначала собирают реальные рабочие deliverables специалистов той же роли, извлекают из них компетенции, синтезируют рубрику и затем валидируют её.
Это не просто более трудоёмкий способ написать чек-лист. Рубрики, полученные на уровне роли, можно переносить между задачами этой роли. По оценке авторов, это снижает расчётные затраты на создание критериев для одной задачи в 6,7 раза по сравнению с написанием каждой рубрики с нуля.
Авторы разделили 57 профессий на две группы: 30 ролей с хорошо представленными в обучающих данных общими конвенциями и 27 специализированных ролей, где такие конвенции выражены слабее.
Для первой группы разрыв почти исчезает: подход только с промптом получил 89,2% против 90,7% у RGRC. То есть в привычной области модель уже может примерно восстановить ожидаемые стандарты из контекста задания.
В специализированных ролях картина меняется резко: 78,0% у prompt-only против 99,1% у рубрик, заземлённых в профессиональных deliverables. Это важное ограничение модной идеи «достаточно хорошо написать промпт». Если нужный стандарт не является частью устойчивого prior модели, инструкция не заменит образцы настоящей работы.
В набор вошли 1 723 отобранных deliverables из 57 профессий, 8 финансовых подотраслей и 161 типа документов или результатов работы. Первая опубликованная часть оценки включает 20 полноценных задач для 20 ролей в 7 подотраслях.
На этой выборке человеческие deliverables в среднем заняли первое место — 73,7 балла против 70,3, 70,2 и 69,6 у четырёх систем. Но здесь важно не переинтерпретировать результат: 95%-ные доверительные интервалы всех систем пересекались, а сами системы демонстрировали разные сильные стороны.
Поэтому FinProBench не доказывает, что модели уже бесполезны в финансах. Он показывает другое: средний балл без ролевой рубрики может скрывать провал именно там, где работа требует узкой профессиональной интуиции.
Для разработчиков агентов практический рецепт довольно прямой. Если задача относится к распространённой роли, prompt-based оценка может быть приемлемым дешёвым приближением. Если же агент должен работать в узком домене, сначала нужны реальные образцы результата и критерии, извлечённые из практики этой роли. Иначе агент можно оптимизировать под красивый ответ, который профессионал сразу сочтёт неправильным.
Ограничение исследования тоже стоит держать в голове: на данный момент опубликован начальный evaluation set всего из 20 задач, а выводы основаны на конкретной процедуре и наборе профессиональных материалов. Следующий важный вопрос — насколько устойчиво преимущество RGRC за пределами финансовой области и при изменении самих ролей.
Источник: cs.AI updates on arXiv.org