Коротко
Сегодня — о том, как проверять код, созданный агентами, и что происходит с агентным веб-поиском. Плюс несколько полезных разборов о бенчмарках, инструкциях и сбоях моделей.
Сегодня — о том, как проверять код, созданный агентами, и что происходит с агентным веб-поиском. Плюс несколько полезных разборов о бенчмарках, инструкциях и сбоях моделей.
🔥 Hot:
🔹 MAGS предлагает формально проверять выводы coding-агентов — Авторы рассматривают многоагентную автоформализацию как способ находить ошибки, которые могут пропустить fuzz-тесты, статический анализ и LLM-проверяющие. 🔹 Исследование сравнивает веб-поиск в ChatGPT, Claude, Grok и DeepSeek — Работа разбирает полный цикл агентного поиска: решения о поиске, стратегии, результаты и итоговые ответы. 🔹 Новое исследование проверяет, понимают ли AI-агенты компьютерную архитектуру — Улучшение аппаратного дизайна ещё не доказывает, что агент понял устройство системы, а не просто удачно перебрал параметры.
➡️ Полезные материалы:
🔹 Исследователи предлагают виртуализировать foundation models через слой саморазвивающейся ОС — Идея должна унифицировать состояние, память, бюджеты и защитные ограничения в составных агентных системах. 🔹 Исследование показывает, что бенчмарки отражают меняющиеся ожидания от LLM — Авторов интересуют не только рейтинги моделей, но и то, какие способности исследователи вообще считают успешными. 🔹 Работа разбирает, чего не хватает современным тестам на систематическое обобщение — Авторы предлагают смотреть на такие задачи через призму рассуждений, а не только упрощённых комбинаций действий. 🔹 Разбор объясняет семь ловушек продуктивности при работе с ИИ — Материал о том, как обещание «успевать больше» может приводить к перегрузке и нездоровым рабочим привычкам.
➡️ Обсуждения и кейсы:
🔹 Практик объясняет, почему «тупость» агента часто начинается с инструкции — Разбор сводит проблемы к трём причинам: правила написаны прозой, сформулированы через запреты или не имеют проверки результата. 🔹 Исследование возвращается к атаке Trusting Trust для саморедактирующихся AI-кодеров — Работа поднимает вопрос о заражении систем, которые способны изменять собственный код. 🔹 Пользователь показал, как Ternary Bonsai 2 27B зацикливается на сложной задаче — Модель вместо создания игры с исследованием планеты повторяет один и тот же ход рассуждений.
📝 Если хотите дополнить список другими новостями и материалами, пишите в комментариях.