Коротко
Исследование Cisco Talos показывает: модели часто принимают заявление о легитимности атаки за доказательство. Для защиты компаниям придётся проверять контекст и подключать агентов к SOC, а не надеяться только на отказы LLM.
AI-guardrails часто ломаются не под натиском сложного jailbreak, а после фразы «это мой сервер». Исследование Cisco Talos показывает неприятную вещь: модель может принять заявление пользователя о легитимности операции за достаточное основание помочь с потенциальной атакой.
Talos изучила журналы промптов и артефакты с устройств предполагаемых злоумышленников, где использовались Claude Code, Codex, Cursor и Gemini. Исследователи не обнаружили сложных схем кодирования или изощрённых трюков: во многих случаях хватало заявить, что работа ведётся на собственной инфраструктуре, в рамках capture-the-flag или bug bounty.
Это важное различие. Защита моделей неплохо реагирует на явно сформулированную вредоносную цель, но гораздо хуже — на вопрос о том, кто имеет право эту цель преследовать. А проверить такое право внутри обычного диалога невозможно: модель видит утверждение, но не видит договор, scope тестирования или разрешение владельца системы.
Есть и более системная проблема. Злоумышленники разбивают операцию на отдельные задачи и разносят их по разным сессиям и файлам. Каждая просьба по отдельности выглядит безобидно, но вместе они могут складываться в полноценную цепочку атаки. Похожий эффект дают дополнительные memory-файлы, markdown-документы и системные инструкции, которые меняют контекст поведения ассистента.
В случае с фреймворком Hephaestus Talos отдельно отмечает другой подход: действия описываются нейтральными глаголами, без явного обозначения вредоносной цели. Агент выполняет последовательность «невинных» запросов и не получает всей картины происходящего. Это уже не классический обход запрета, а эксплуатация разрыва между локальным запросом и глобальным намерением.
При этом AI не превращает любого новичка в компетентного хакера. По оценке исследователей, неподготовленные операторы способны собрать технически работающие, но слабые проекты, тогда как опытные атакующие используют модели как множитель своих возможностей. Иными словами, главный риск — не армия автономных гениев, а ускорение работы тех, кто уже понимает, что делает.
Отсюда следует практический вывод для защиты: одних отказов модели недостаточно. Если агенты становятся частью SOC, им нужно не только фильтровать текст запросов, но и сопоставлять действия с реальными правами, активами, заявками и границами разрешённого тестирования. Иначе система будет проверять формулировку команды, пока атака будет продолжаться на уровне всей цепочки.
Talos ожидает, что организациям придётся активнее использовать агентные инструменты для разбора растущего потока событий и выделения действительно важных алертов. На это есть и более жёсткая причина: по данным CrowdStrike, атаки с участием AI-enabled adversaries за год выросли на 89%, а практическое окно для установки патчей в отдельных случаях сократилось до 24–48 часов.
Но внедрять агента в SOC без контроля контекста — значит повторить ту же ошибку, которую уже совершают атакующие. Защищать нужно не только модель от плохого запроса, но и инфраструктуру от правдоподобной истории, которую ей рассказали.
Источник: Hacker News - Newest: ""AI" "LLM""