Коротко
Исследователи из arXiv показывают, что стандартный подход к памяти мультимодальных агентов систематически путает сущности. ViSAGE решает это через ретроспективную коррекцию и отказ от ответа — и это важнее, чем +5.9% точности.
Когда мультимодальный агент работает с длинным видео, ему нужна память — иначе он не свяжет человека в первом кадре с тем же человеком через полчаса. Стандартный рецепт: сжимать сегменты, складывать в векторную базу, искать по сходству. Проблема в том, что этот рецепт систематически врёт об идентичности сущностей.
Векторная близость ловит семантически похожие фрагменты, но не гарантирует, что это тот же объект или персонаж. Агрессивное сжатие и покадровая нарезка только усугубляют дело: тонкие признаки идентичности стираются ещё до записи. Результат — перепутанные сущности, каскад ошибок и галлюцинации, которые невозможно отследить до конкретного сбоя в памяти.
Фреймворк ViSAGE предлагает три механизма, и каждый бьёт в конкретное слабое место.
Кросс-модальное связывание привязывает идентичность сущности к разным модальностям на длинных временных отрезках — вместо того, чтобы полагаться на попиксельное или текстовое сходство в моменте.
Двунаправленная очистка памяти — самое интересное. Когда свидетельство идентичности появляется с задержкой (что в длинных видео норма), ViSAGE не просто обновляет текущий контекст, а ретроспективно переписывает исторические записи. Прошлое корректируется в свете новых данных, и будущие выводы строятся уже на объединённой картине.
Мультиагентная перекрёстная проверка добавляет ограничение выравнивания доказательств: если свидетельство не подтверждает идентичность, агент не угадывает, а отказывается отвечать. Для продакшена это важнее любой точности — возможность сказать «не знаю» вместо уверенной галлюцинации.
В экспериментах ViSAGE обходит сильнейший baseline на 5.9% точности. Но цифра вторична. Главное — это демонстрация того, что векторный поиск как универсальный механизм памяти агентов имеет структурный изъян: он оптимизирован на похожесть, а не на идентичность. Для коротких задач это незаметно, для длинных горизонтов — критично.
Практический вывод для тех, кто строит агентов с долгоживущей памятью: если сущности могут повторяться или эволюционировать во времени, чистого RAG недостаточно. Нужна либо ретроспективная коррекция записей, либо явная модель идентичности с возможностью abstain. Иначе агент будет уверенно путать объекты — и вы потратите недели на отладку галлюцинаций, причина которых лежит не в модели, а в архитектуре памяти.
Источник: cs.AI updates on arXiv.org