Коротко
Аудит четырёх популярных agent-safety бенчмарков показал: метрика F1 позволяет тривиальной политике обойти реальные модели, а ранжирование зависит от размера панели. Способность и безопасность связаны отрицательно — но только на маленьких выборках.
Когда вы читаете «наш агент безопасен, потому что набрал X на R-Judge», вы, скорее всего, смотрите на число, которое почти ничего не значит. Аудит четырёх популярных agent-safety бенчмарков — R-Judge, InjecAgent, AgentHarm и AgentDojo — показывает, что их оценки цитируются как взаимозаменяемые, хотя они измеряют разные поведения и расходятся в ранжировании одних и тех же моделей.
Источник: cs.AI updates on arXiv.org