• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Albert Stoynov / Unsplash

Бенчмарки безопасности агентов врут: «всегда одобряй» обходит половину моделей

Sh0ny
Sh0ny
4 августа 2026
  1. Главная
  2. Блог
  3. Бенчмарки безопасности агентов врут: «всегда одобряй» обходит половину моделей
1 мин чтения

Коротко

Аудит четырёх популярных agent-safety бенчмарков показал: метрика F1 позволяет тривиальной политике обойти реальные модели, а ранжирование зависит от размера панели. Способность и безопасность связаны отрицательно — но только на маленьких выборках.

Когда вы читаете «наш агент безопасен, потому что набрал X на R-Judge», вы, скорее всего, смотрите на число, которое почти ничего не значит. Аудит четырёх популярных agent-safety бенчмарков — R-Judge, InjecAgent, AgentHarm и AgentDojo — показывает, что их оценки цитируются как взаимозаменяемые, хотя они измеряют разные поведения и расходятся в ранжировании одних и тех же моделей.

Источник: cs.AI updates on arXiv.org

новостиaiагентыбезопасность
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​