• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Christina @ wocintechchat.com M / Unsplash

Логи AI-агента не доказывают, что он делал

Sh0ny
Sh0ny
6 августа 2026
  1. Главная
  2. Блог
  3. Логи AI-агента не доказывают, что он делал
2 мин чтения

Коротко

Чем ближе аудит к самому агенту, тем понятнее его рассказ — и тем меньше ему можно доверять. Надёжная проверка начинается за пределами sandbox, но там возникает другая проблема: как превратить сырые события инфраструктуры в понятный отчёт.

Если AI-агент получил доступ к продакшену, его собственный лог нельзя считать доказательством. Взломанный или просто ошибающийся агент может исказить рассказ о своих действиях, а монитор в том же контейнере разделит с ним ту же уязвимость.

Главный вывод авторов NOFire неудобен для всех, кто привык считать трассировку источником истины: аудит зависит не только от того, что записывают, но и от того, откуда наблюдают.

Чем дальше наблюдатель, тем выше доверие

У авторов получается лестница из трёх уровней. На первом — транскрипт агента, его tool calls и собственное описание сессии. Это самый удобный для чтения слой, но агент может читать и менять всё, что доступно ему самому.

На втором — наблюдатель внутри гостевой системы. Он видит процессы, файлы и соединения лучше, однако всё ещё находится в радиусе поражения: полностью скомпрометированная виртуальная машина теоретически может обмануть и его.

На третьем — граница виртуальной машины. Пакеты, операции с диском и выходы из VM фиксируются со стороны хоста, куда гостю не добраться. Такой журнал беднее по смыслу, зато его нельзя переписать изнутри.

Это не означает, что нужно выбросить обычные логи. Их роль просто меняется: рассказ агента становится гипотезой, наблюдение внутри VM — дополнительным свидетельством, а события на границе — проверкой, с которой нужно сверять оба слоя.

Самый полезный сигнал — противоречие

Если агент говорит, что только прочитал конфигурацию, а внешний журнал показывает исходящее соединение, это уже достаточная причина не доверять сессии. Неважно, агент солгал, ошибся или неправильно описал действие: расхождение зафиксировано сигналом, который он не мог подделать.

Именно здесь аудит превращается из чтения красивого нарратива в расследование. Совпадение слоёв повышает уверенность, а расхождение помогает быстро найти место, где нужна проверка.

Но есть практическая загвоздка. Сырые записи вроде «соединение с адресом» или «серия операций ввода-вывода» отвечают на вопрос о фактах, но не на вопрос «что сделал агент». NOFire предлагает решать это через intent lifting: сопоставлять характерные шаблоны сетевой активности и I/O с операциями вроде клонирования репозитория, установки зависимости или вызова API, а уверенность указывать отдельно.

Идея выглядит разумно именно потому, что агенты работают через повторяющийся набор действий. Но это не магическое восстановление намерений: классификация остаётся интерпретацией поверх фактов, а не самими фактами.

Где заканчивается уверенность

Авторы утверждают, что наблюдение на границе пассивное, не вмешивается в горячий путь и достаточно дёшево, чтобы включать его для каждой задачи в продакшене. При этом полноценные измерения и методика обещаны в отдельной публикации, а количественные результаты здесь не приведены.

Остаются и другие открытые вопросы: насколько точно taxonomy восстанавливает намерения, как система ведёт себя при конфликте слоёв в реальных инцидентах и где проходит граница между полезной агрегацией и слишком смелой интерпретацией.

Практический совет из этого разбора простой: не выбирайте между логами агента и инфраструктурной телеметрией. Храните оба слоя, явно разделяйте факт и рассказ и поднимайте любое расхождение до уровня инцидента. Для постмортема это намного честнее, чем фраза «агент сообщил, что всё сделал правильно».

Если бы вам пришлось расследовать сбой AI-агента сегодня, доверились бы вы его логам или стали бы заранее собирать свидетельства за пределами его sandbox? Источник: Hacker News - Newest: ""AI" "LLM""

новостиaiагентыбезопасность
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​