Коротко
SPOT показывает, как агент с глубоким обучением выбирает действие и к каким последствиям ведёт этот выбор. Но такая прозрачность появляется только там, где есть рабочий симулятор среды.
Главная проблема объяснений для reinforcement learning в том, что они часто отвечают только на вопрос: почему агент выбрал это действие сейчас? Метод SPOT предлагает смотреть дальше — построить несколько возможных продолжений и увидеть, как меняется поведение политики.
Для этого SPOT берёт доступ к самой policy и симулятору среды. Он перебирает действия, моделирует возникающие состояния и рекурсивно собирает конечное дерево. В результате получается не красивая история, придуманная после принятия решения, а эмпирическая карта предпочтений агента и их возможного развития на несколько шагов вперёд.
Это полезно для практической проверки. Можно сравнить альтернативные траектории, заметить отложенные последствия и понять, что агент предпочитает не из-за одного признака на текущем шаге, а ради поведения в будущем. В эксперименте с управлением светофорами SUMO-RL такой подход показывает то, что методы attribution для одного момента могут не увидеть.
Авторы также дают формальные гарантии: при достаточном числе выборок SPOT асимптотически восстанавливает наиболее вероятное действие политики, если оно единственное, и описывает случаи расхождения при политике с высокой энтропией.
Но здесь и главный trade-off. SPOT не превращает нейросеть в полностью понятную систему: дерево ограничено конечным горизонтом, строится выборочным моделированием и зависит от наличия корректного симулятора. Это скорее инструмент для проверки сценариев и поиска странных последствий, чем универсальный переводчик внутренних рассуждений агента. Если среда плохо моделируется, уверенное дерево может описывать не реальное будущее, а ошибки симуляции.
Для каких задач вы бы доверили объяснению в виде дерева сценариев, а где потребовали бы проверку на реальной среде? Источник: cs.AI updates on arXiv.org