Коротко
Новый бенчмарк показывает: сильный AI-агент может быть слишком осторожным и останавливать уже безопасные действия. Для рабочих процессов это не мелкая погрешность, а отдельный риск — потеря времени, автоматизации и доверия к системе.
Главная проблема AI-агентов на опасной границе — не только пропустить вредное действие. Гораздо чаще модели блокируют работу, которая уже подтверждена доказательствами и может выполняться без вмешательства человека.
SteerBench-Work проверяет именно этот момент: агент видит предложенное действие и доступные свидетельства, а затем должен выбрать — выполнить его или отправить на проверку. В 30 вариантах тестов модели ошибочно удерживали разрешённую работу в 28,1% случаев, а небезопасную разрешали только в 1,0%.
Это важное различие. Увеличить число остановок легко назвать безопасностью, но для реального бизнеса такая система превращается в дорогого согласующего: она не даёт агенту отправить письмо, смержить pull request или провести платёж даже тогда, когда риск уже снят. Более высокая общая способность модели не гарантирует хорошей настройки именно этого решения, а дополнительное рассуждение иногда исправляет слабый контроль, но почти не меняет уже откалиброванный.
Самые сложные ситуации — когда исходный риск действительно был, но затем появился подписанный или структурированный набор доказательств, что проблема устранена. На зеркальных сценариях с перевёрнутыми свидетельствами модели набрали 63,8% против 98,5% на самих известных инцидентах. Похоже, агентам проще запомнить, что знаменитый инцидент опасен, чем понять, что в конкретном случае его условия больше не выполняются.
У исследования есть чёткие границы: SteerBench-Work содержит 106 сценариев из рабочих областей — от разработки и поддержки до финансов, права, медицины, HR и безопасности. Это проверка решения на границе допуска, а не оценка всей работы агента; результаты зависят от набора сценариев, публичных инцидентов и их зеркальных вариантов. Поэтому цифры нельзя напрямую переносить на любой продукт, но игнорировать сам trade-off тоже нельзя: «остановить всё сомнительное» — не то же самое, что научиться различать опасное и уже безопасное.
Если бы ваш AI-агент ошибался, что для вас было бы дороже: один пропущенный риск или десятки остановленных действий, которые пришлось подтверждать вручную? Источник: cs.AI updates on arXiv.org