• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Arthur Edelmans / Unsplash

AI-агентам предложили чинить проблемы, а не переписывать себя заново

Sh0ny
Sh0ny
10 августа 2026
  1. Главная
  2. Блог
  3. AI-агентам предложили чинить проблемы, а не переписывать себя заново
1 мин чтения

Коротко

ADIAS меняет логику автоматического улучшения агентов: система хранит историю конкретных проблем и результатов попыток исправления. Такой подход оказался сильнее базового в пяти интерактивных тестах, но пока неясно, насколько результат переносится на реальные проекты.

Главный недостаток автоматической доработки AI-агентов может быть не в качестве кода, а в плохой памяти. Если на каждом раунде система снова смотрит на историю кандидатов, она рискует повторять неудачные исправления и терять уже найденный прогресс.

В работе ADIAS эту логику перевернули. Вместо того чтобы считать главным объектом очередную версию агента, система ведёт список устойчивых проблем: что именно сломано, какие есть подтверждения, на каком этапе находится исправление и чем закончились прошлые попытки.

Это важный сдвиг: агент оптимизируется не по принципу «сгенерируй ещё одну улучшенную версию», а по принципу «выбери следующую проблему и измени код с учётом уже полученных результатов». Такой подход должен уменьшать бессмысленные повторы и помогать собирать частичные улучшения в цельную систему.

На пяти интерактивных бенчмарках ADIAS в среднем превзошёл самый сильный базовый метод на 25,2%. Результат сохранялся на четырёх базовых моделях. В контрольных экспериментах удаление постоянного состояния проблем или возврат к стратегии, ориентированной на кандидатов, снижали качество — максимум на 40,7%.

Но это пока не готовое доказательство практической универсальности. В аннотации не раскрыты сами задачи, стоимость итераций, детали сравнения с базовым методом и то, насколько хорошо метод работает за пределами этих пяти бенчмарков. Поэтому главный вывод осторожнее рекламного: ADIAS показывает, что для сложных агентов полезнее накапливать карту неисправностей, чем просто плодить новые версии кода.

Если бы вы автоматизировали улучшение собственного агента, что было бы ценнее: десятки новых вариантов кода или подробная история того, какие проблемы уже пытались исправить? Источник: cs.AI updates on arXiv.org

новостиaiагентыразработка
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​