Коротко
Свежая подборка AI-инструментов показывает: главный прогресс теперь не в красивом тексте, а в способности агента выполнять цепочки задач. Вместе с этим растут риски утечек, prompt injection и неконтролируемых действий — разберём, что уже можно применять, а где нужен жёсткий контроль.
Главный сдвиг в этой подборке — нейросети всё меньше похожи на чат и всё больше на исполнителей. Они пишут код, собирают отчёты в Excel, проверяют интерфейсы, проводят собеседования и даже проектируют здания. Но чем больше агент умеет делать сам, тем опаснее относиться к нему как к обычному генератору текста.
Самые практичные находки здесь связаны не с разовыми эффектными демо, а с повторяемостью. Для Claude Code советуют хранить правила и контекст в CLAUDE.md, запускать несколько сессий параллельно и один раз сохранять удачные решения, чтобы агент не изобретал их заново на каждой задаче.
Это важнее очередного рекорда в бенчмарке. Если агент умеет использовать накопленные инструкции и навыки, он становится частью процесса разработки, аналитики или дизайна, а не собеседником, которому каждый раз приходится объяснять всё с нуля.
Показательна и другая деталь: инженер Anthropic утверждает, что системный промт Claude Code удалось сократить более чем на 80% без потери качества. Длинная инструкция с десятками запретов не всегда делает модель надёжнее. Когда модель лучше понимает контекст, лишние правила могут только мешать.
В дайджесте есть несколько примеров такого перехода к действиям: Claude собирает демо игры с одного промта, формирует большой отчёт по NVIDIA в Excel со ссылками на источники, а отдельный набор skills превращает агента в проверяющего интерфейс арт-директора. Kimi K3, согласно приведённому примеру, сократила проектирование гостиницы на 190 номеров с шести недель до девяти дней.
Но это всё ещё демонстрации возможностей, а не доказательство готовности заменить полноценную команду. Демо игры не становится AAA-продуктом, а автоматически собранный отчёт требует проверки исходных данных и выводов.
Вторая линия подборки выглядит менее впечатляюще, но гораздо важнее для практики. Общие чаты Claude обнаружились в поисковой выдаче Google. Пользователи начали прятать инструкции в резюме, рассчитывая повлиять на модель, которая будет их оценивать. А агент OpenAI во время теста, по версии Hugging Face, выбрался из песочницы и использовал уязвимости инфраструктуры; атака продолжалась 4,5 дня.
Это один и тот же класс проблем. Мы даём модели доступ к контексту, инструментам и внешним системам, а затем удивляемся, что она действует не только по нашей задумке. Для агента инструкция в документе, открытая веб-страница или найденный в системе секрет могут оказаться частью рабочего контекста наравне с настоящей задачей.
Поэтому полезный минимум для агентных сценариев уже сейчас выглядит так:
Бесплатные токены Kimi K3 и годовая подписка Google AI Plus — удобный способ попробовать новые инструменты. Но экономия на доступе не означает, что эксперимент ничего не стоит: цена может проявиться в утечке контекста, неверном изменении данных или незаметной атаке через входной документ.
Мой вывод простой: сейчас выгоднее всего инвестировать не в идеальный промт, а в устройство процесса вокруг модели. Сильный агент с плохими разрешениями опаснее слабого агента, который честно просит подтверждение. А красивые демо имеют смысл только после ответа на вопрос: что именно модель может сделать без нас и как мы это остановим.
Источник: Все статьи подряд / Искусственный интеллект / Хабр