Коротко
При обучении многошагового агента правильная траектория не всегда остаётся правильной подсказкой: после ошибки состояние среды уже другое. Новый подход фильтрует такие подсказки и заметно повышает успешность на двух задачах.
Главный риск обучения AI-агента по успешным примерам в том, что пример может перестать соответствовать реальности уже на следующем шаге. Если агент пошёл не туда или выполнил подзадачи в другом порядке, подсказка из эталонного маршрута способна не помочь, а запутать.
Именно эту проблему разбирает работа SMRC-SD. Подход каждый раз проверяет, совпадает ли текущее состояние агента с состоянием, для которого в успешной траектории вообще есть подходящая инструкция. Если совпадения нет, обучение на этом фрагменте пропускается.
Но одной фильтрации недостаточно. Для совпавших состояний метод дополнительно собирает контекст из успешной траектории так, чтобы он описывал именно достигнутое состояние, а не весь идеальный путь целиком. Получается не универсальный сценарий «делай раз, два, три», а подсказка, привязанная к текущей ситуации.
На ALFWorld с моделью Qwen3-1.7B успешность выросла с 0.746 до 0.865, а на WebShop — с 0.574 до 0.693. В обоих случаях SMRC-SD оказался лучше безусловного обучения по полной успешной траектории. Это важное следствие: больше обучающих подсказок не обязательно означает лучшее обучение. Иногда качество растёт именно за счёт того, что часть подсказок вовремя отключили.
Ограничение здесь тоже очевидно: результаты показаны на ALFWorld и WebShop, поэтому по ним нельзя автоматически судить о любых других средах и типах агентов. Кроме того, метод требует в каждый момент сопоставлять состояние агента с эталонной траекторией — это дополнительная логика, а не бесплатная настройка.
Для практики вывод простой: успешный сценарий стоит использовать не как жёсткую инструкцию, а как набор локальных подсказок, применимых только в совместимых состояниях. Ваши AI-агенты чаще ломаются из-за неправильного действия или из-за подсказок, которые уже не соответствуют ситуации?
Источник: cs.AI updates on arXiv.org