• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: FlyD / Unsplash

Главное об AI-агентах: безопасность, поиск и рабочие инструкции

Sh0ny
Sh0ny
18 сентября 2026
  1. Главная
  2. Блог
  3. Главное об AI-агентах: безопасность, поиск и рабочие инструкции
2 мин чтения

Коротко

Сегодня — о том, как проверять код, созданный агентами, и что происходит с агентным веб-поиском. Плюс несколько полезных разборов о бенчмарках, инструкциях и сбоях моделей.

Сегодня — о том, как проверять код, созданный агентами, и что происходит с агентным веб-поиском. Плюс несколько полезных разборов о бенчмарках, инструкциях и сбоях моделей.

🔥 Hot:

🔹 MAGS предлагает формально проверять выводы coding-агентов — Авторы рассматривают многоагентную автоформализацию как способ находить ошибки, которые могут пропустить fuzz-тесты, статический анализ и LLM-проверяющие. 🔹 Исследование сравнивает веб-поиск в ChatGPT, Claude, Grok и DeepSeek — Работа разбирает полный цикл агентного поиска: решения о поиске, стратегии, результаты и итоговые ответы. 🔹 Новое исследование проверяет, понимают ли AI-агенты компьютерную архитектуру — Улучшение аппаратного дизайна ещё не доказывает, что агент понял устройство системы, а не просто удачно перебрал параметры.

➡️ Полезные материалы:

🔹 Исследователи предлагают виртуализировать foundation models через слой саморазвивающейся ОС — Идея должна унифицировать состояние, память, бюджеты и защитные ограничения в составных агентных системах. 🔹 Исследование показывает, что бенчмарки отражают меняющиеся ожидания от LLM — Авторов интересуют не только рейтинги моделей, но и то, какие способности исследователи вообще считают успешными. 🔹 Работа разбирает, чего не хватает современным тестам на систематическое обобщение — Авторы предлагают смотреть на такие задачи через призму рассуждений, а не только упрощённых комбинаций действий. 🔹 Разбор объясняет семь ловушек продуктивности при работе с ИИ — Материал о том, как обещание «успевать больше» может приводить к перегрузке и нездоровым рабочим привычкам.

➡️ Обсуждения и кейсы:

🔹 Практик объясняет, почему «тупость» агента часто начинается с инструкции — Разбор сводит проблемы к трём причинам: правила написаны прозой, сформулированы через запреты или не имеют проверки результата. 🔹 Исследование возвращается к атаке Trusting Trust для саморедактирующихся AI-кодеров — Работа поднимает вопрос о заражении систем, которые способны изменять собственный код. 🔹 Пользователь показал, как Ternary Bonsai 2 27B зацикливается на сложной задаче — Модель вместо создания игры с исследованием планеты повторяет один и тот же ход рассуждений.

📝 Если хотите дополнить список другими новостями и материалами, пишите в комментариях.

новости
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться

Комментарии

(0)
​