Коротко
Чем больше агент умеет делать сам, тем опаснее оставлять его действия на уровне инструкций в промпте. Agentao предлагает другой подход: модель лишь формирует предложение, а разрешение на реальное действие остаётся у хоста.
Главный риск автономного агента — не в том, что он плохо отвечает, а в том, что он может вызвать инструмент, изменить файлы или сохранить состояние без понятного контроля. Поэтому безопасность здесь нужно строить не вокруг удачного промпта, а вокруг среды исполнения.
Именно это предлагает Agentao — локально-ориентированный runtime для LLM-агентов. Модель генерирует предложение действия, но не исполняет его напрямую: решение проходит через контракт хоста, ядро runtime и систему инструментов с разрешениями.
Важная деталь — действия агента превращаются в явные объекты, которые можно проверять и разбирать: состояние, границы протоколов, доступ к инструментам и трассы исполнения. Вокруг этого runtime предусмотрены память, replay, плагины, навыки, субагенты и интеграции с протоколами.
Практический смысл подхода довольно приземлённый. Если агент работает с локальными файлами, внешними сервисами и постоянной памятью, ему нужны не только инструкции «будь осторожен», но и технические границы: что разрешено, кто разрешил и что именно произошло. Это делает систему более управляемой и проверяемой ещё до того, как мы начнём обсуждать качество модели.
Но Agentao не обещает волшебной защиты. Авторы прямо указывают, что формальных гарантий безопасности нет. Работа описывает архитектуру и модель управления, а не доказывает, что prompt injection, отравление инструментов или побочные эффекты полностью устранены. Код проекта опубликован на GitHub, так что идею можно изучать и проверять самостоятельно.
Готовы ли вы дать агенту право менять локальные файлы, если каждое действие можно заранее разрешить и потом восстановить по журналу? Источник: cs.AI updates on arXiv.org