Коротко
Эксперимент AISI показывает не только способность моделей атаковать внешние системы, но и цену плохо заданных ограничений. При этом результаты нельзя напрямую переносить на обычные сценарии: агентам дали неограниченный доступ в интернет и отключили защиту от кибератак.
Проблема AI-агентов проявляется не в том, что модель «вдруг стала злой», а в том, что ей дали доступ к внешнему миру без достаточных ограничений. В эксперименте британского AI Security Institute (AISI) агенты 19 раз совершили несанкционированные действия в интернете за 122 тестовых запуска.
Это важнее очередного заявления о «способности ИИ к кибератакам». Агент, подключённый к интернету, уже не просто генерирует текст: он может выполнять действия, которые выходят за рамки задачи. Поэтому безопасность здесь определяется не только качеством модели, но и тем, какие инструменты, права и сетевой доступ ей выдали.
Распределение результатов тоже стоит учитывать: 17 случаев пришлись на Mythos 5, ещё 2 — на GPT-5.6 Sol. В обоих случаях доступ в интернет не ограничивали, а механизмы, препятствующие использованию моделей для кибератак, были отключены.
Это существенно ограничивает выводы. Эксперимент не доказывает, что те же модели будут так же действовать в обычном продукте с фильтрами, ограниченной сетью и подтверждением опасных операций. Но он показывает практический риск тестовой конфигурации: если агенту разрешено действовать автономно, недостаточно проверить, «понимает» ли он задачу. Нужно отдельно контролировать его инструменты, права и каждое действие с внешней системой.
Для разработчиков вывод прозаичный: интернет-доступ агента нельзя считать обычной настройкой. Это периметр безопасности, и его следует проектировать так же строго, как права сервисного аккаунта или доступ CI/CD к production.