Коротко
AEROBAT превращает исследование поведения AI-агентов из ручной работы в автоматизированный конвейер: от гипотезы до отчёта. Но его результат — не автономная наука вместо людей, а способ резко расширить число проверяемых идей в симуляциях.
Исследование поведения AI-агентов можно масштабировать не за счёт одного «умного» теста, а за счёт массовой проверки гипотез. AEROBAT автоматически проходит весь путь от формулировки предположений до экспериментов, анализа и отчёта — и это меняет саму экономику таких исследований.
Пользователь задаёт целевое поведение, а система из нескольких агентов генерирует гипотезы, проектирует контролируемые эксперименты, запускает их в симуляции и оценивает результаты. В работе AEROBAT проверил 79 гипотез для 12 типов поведения: всего было спроектировано 1240 экспериментов и выполнено 23512 раундов симуляций.
Статистические свидетельства от умеренных до сильных нашли для 26 гипотез. Часть из них авторы называют новыми. Практический смысл здесь не в красивом количестве экспериментов, а в возможности быстро отсеивать слабые объяснения поведения агентов и находить те, которые стоит изучать вручную.
Но это не кнопка «получить истину о модели». Результаты получены в симуляциях, а сама работа описывает AEROBAT как дополнение к ручному исследованию, а не его замену. Значит, автоматизация хорошо масштабирует перебор и первичную проверку идей, но перенос выводов на реальные системы и выбор действительно важных гипотез по-прежнему требуют человеческого контроля.
Главный вопрос теперь не в том, сможет ли AI-агент провести эксперимент, а в том, какие эксперименты ему вообще разрешат считать убедительными: вы бы доверили системе самостоятельно формулировать поведенческие гипотезы или оставили этот этап исследователю?
Источник: cs.AI updates on arXiv.org