Коротко
Успешная навигация ещё не доказывает, что embodied-агент понимает пространство и действует безопасно. MetaSpace предлагает проверять не только финальный результат, но и логические ошибки по всему пути выполнения.
Агент может довести робота до нужной точки и при этом ошибаться в базовой пространственной логике. Именно такие сбои обычно теряются за метрикой «задача выполнена», хотя они могут означать неэффективное или небезопасное поведение.
MetaSpace переносит в оценку embodied-агентов идею metamorphic testing из разработки. Вместо того чтобы вручную размечать бесконечное число вопросов и ответов, система берёт реальные траектории выполнения и проверяет их по правилам, связанным с логикой и физическими законами.
Эти правила формализованы на Prolog. Например, система может искать нарушения отношений между объектами, состояниями и действиями во времени. Если агент успешно закончил задачу, но по дороге сделал несовместимый с физикой или логикой шаг, это становится отдельной ошибкой, а не растворяется в общей оценке успеха.
В экспериментах на трёх embodied-сценариях MetaSpace обнаружил 90 422 ошибки пространственного мышления у современных агентов на базе MLLM. Авторы также ввели показатель Spatial Cognition (SC): средние результаты агентов оказались в диапазоне 0,44–0,52 против 0,96 у людей.
Здесь и находится главный практический вывод: тестировать нужно не только «дошёл ли робот», но и «понимал ли он, что делает». Иначе система может выглядеть рабочей благодаря удачному финалу, случайному маршруту или поведению, которое в другой обстановке приведёт к проблеме.
Но это не универсальный приговор всем embodied-агентам. Исследование проверяет подход на трёх сценариях, а аннотация не раскрывает их детали и состав тестов. Кроме того, ручная разметка действительно дорога и нестабильна, но автоматические правила тоже требуют аккуратной формализации: плохое или неполное правило способно не заметить нужную ошибку.
Если робот выполнил задачу, но нарушил пространственную логику по пути, вы бы считали это успехом или провалом? Источник: cs.AI updates on arXiv.org