Коротко
Anthropic делает автоматический режим Claude Code настройкой по умолчанию, потому что постоянные подтверждения усыпляют внимание человека. Но цифры из собственной проверки компании показывают не «решённую безопасность», а новый вопрос: что происходит в оставшихся 11% опасных сценариев?
С 14 августа auto mode станет настройкой по умолчанию для новых сессий Claude Code на тарифах Pro, Max и Team. Ставка понятна: агенту больше не нужно просить человека подтвердить каждое действие — и это может быть безопаснее, чем механически нажимать «ОК» десятки раз подряд.
В тесте с 1 053 платными участниками людям иногда подменяли обычный запрос на явно опасную команду. Отказались её выполнять только 13,6% участников. Auto mode заблокировал 89% таких действий.
Это важный результат, но маркетинговый вывод здесь легко сделать слишком широким. Auto mode не доказывает, что агент стал безопасным. Он показывает, что человек, уставший от постоянных разрешений, может быть худшим фильтром, чем автоматическая политика.
Иными словами, проблема не исчезла — изменился её центр. Раньше мы доверяли человеку, который должен был проверять каждое действие. Теперь больше доверяем самому агенту и правилам auto mode. Это разумный trade-off, если подтверждения превращаются в ритуал, но цена ошибки становится выше: пользователь может даже не увидеть момент, когда агент сделал что-то опасное.
С prompt injection ситуация ещё менее определённая. Anthropic сообщает о внешней оценке Trajectory Labs: в 72 сценариях косвенных атак, всего 720 попыток, ни одна не сработала против Claude Fable 5, Opus 5 или Sonnet 5 в auto mode. Звучит впечатляюще, но это всё ещё одна оценка, проведённая по выбранному набору сценариев. Независимого подтверждения такого результата автор материала считает недостаточным.
Ограничение особенно заметно на примере вредоносного стороннего пакета. Он может предложить агенту сначала скачать модельные файлы через другую команду, а эта команда — украсть доступные данные. Непонятно, как auto mode сможет защитить от действия, которое выглядит для модели частью нормальной инструкции. Поэтому надёжнее не только просить агента быть осторожнее, но и ограничивать сам доступ к данным и инструментам, способным нанести ущерб.
Главный практический вывод: auto mode может убрать опасную усталость от подтверждений, но не должен быть единственным контуром защиты. Для рабочих репозиториев и особенно production-среды важнее заранее решить, какие файлы, секреты и команды агент физически не может трогать, даже если поверит вредной инструкции.
Готовы ли вы доверить агенту автоматический режим, если он блокирует большинство опасных действий, но не гарантирует защиту от каждого сценария? Источник: Simon Willison's Weblog