• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: National Cancer Institute / Unsplash

AI-агенты ошибаются не там, где кажется: 28,1% лишних блокировок

Sh0ny
Sh0ny
15 августа 2026
  1. Главная
  2. Блог
  3. AI-агенты ошибаются не там, где кажется: 28,1% лишних блокировок
1 мин чтения

Коротко

Новый бенчмарк показывает: сильный AI-агент может быть слишком осторожным и останавливать уже безопасные действия. Для рабочих процессов это не мелкая погрешность, а отдельный риск — потеря времени, автоматизации и доверия к системе.

Главная проблема AI-агентов на опасной границе — не только пропустить вредное действие. Гораздо чаще модели блокируют работу, которая уже подтверждена доказательствами и может выполняться без вмешательства человека.

SteerBench-Work проверяет именно этот момент: агент видит предложенное действие и доступные свидетельства, а затем должен выбрать — выполнить его или отправить на проверку. В 30 вариантах тестов модели ошибочно удерживали разрешённую работу в 28,1% случаев, а небезопасную разрешали только в 1,0%.

Это важное различие. Увеличить число остановок легко назвать безопасностью, но для реального бизнеса такая система превращается в дорогого согласующего: она не даёт агенту отправить письмо, смержить pull request или провести платёж даже тогда, когда риск уже снят. Более высокая общая способность модели не гарантирует хорошей настройки именно этого решения, а дополнительное рассуждение иногда исправляет слабый контроль, но почти не меняет уже откалиброванный.

Самые сложные ситуации — когда исходный риск действительно был, но затем появился подписанный или структурированный набор доказательств, что проблема устранена. На зеркальных сценариях с перевёрнутыми свидетельствами модели набрали 63,8% против 98,5% на самих известных инцидентах. Похоже, агентам проще запомнить, что знаменитый инцидент опасен, чем понять, что в конкретном случае его условия больше не выполняются.

У исследования есть чёткие границы: SteerBench-Work содержит 106 сценариев из рабочих областей — от разработки и поддержки до финансов, права, медицины, HR и безопасности. Это проверка решения на границе допуска, а не оценка всей работы агента; результаты зависят от набора сценариев, публичных инцидентов и их зеркальных вариантов. Поэтому цифры нельзя напрямую переносить на любой продукт, но игнорировать сам trade-off тоже нельзя: «остановить всё сомнительное» — не то же самое, что научиться различать опасное и уже безопасное.

Если бы ваш AI-агент ошибался, что для вас было бы дороже: один пропущенный риск или десятки остановленных действий, которые пришлось подтверждать вручную? Источник: cs.AI updates on arXiv.org

новостиaiагентыбезопасность
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​