• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Andrea De Santis / Unsplash

Векторный поиск ломает память агента: почему семантическая близость ≠ идентичность

Sh0ny
Sh0ny
4 августа 2026
  1. Главная
  2. Блог
  3. Векторный поиск ломает память агента: почему семантическая близость ≠ идентичность
2 мин чтения

Коротко

Исследователи из arXiv показывают, что стандартный подход к памяти мультимодальных агентов систематически путает сущности. ViSAGE решает это через ретроспективную коррекцию и отказ от ответа — и это важнее, чем +5.9% точности.

Когда мультимодальный агент работает с длинным видео, ему нужна память — иначе он не свяжет человека в первом кадре с тем же человеком через полчаса. Стандартный рецепт: сжимать сегменты, складывать в векторную базу, искать по сходству. Проблема в том, что этот рецепт систематически врёт об идентичности сущностей.

Векторная близость ловит семантически похожие фрагменты, но не гарантирует, что это тот же объект или персонаж. Агрессивное сжатие и покадровая нарезка только усугубляют дело: тонкие признаки идентичности стираются ещё до записи. Результат — перепутанные сущности, каскад ошибок и галлюцинации, которые невозможно отследить до конкретного сбоя в памяти.

Фреймворк ViSAGE предлагает три механизма, и каждый бьёт в конкретное слабое место.

Кросс-модальное связывание привязывает идентичность сущности к разным модальностям на длинных временных отрезках — вместо того, чтобы полагаться на попиксельное или текстовое сходство в моменте.

Двунаправленная очистка памяти — самое интересное. Когда свидетельство идентичности появляется с задержкой (что в длинных видео норма), ViSAGE не просто обновляет текущий контекст, а ретроспективно переписывает исторические записи. Прошлое корректируется в свете новых данных, и будущие выводы строятся уже на объединённой картине.

Мультиагентная перекрёстная проверка добавляет ограничение выравнивания доказательств: если свидетельство не подтверждает идентичность, агент не угадывает, а отказывается отвечать. Для продакшена это важнее любой точности — возможность сказать «не знаю» вместо уверенной галлюцинации.

В экспериментах ViSAGE обходит сильнейший baseline на 5.9% точности. Но цифра вторична. Главное — это демонстрация того, что векторный поиск как универсальный механизм памяти агентов имеет структурный изъян: он оптимизирован на похожесть, а не на идентичность. Для коротких задач это незаметно, для длинных горизонтов — критично.

Практический вывод для тех, кто строит агентов с долгоживущей памятью: если сущности могут повторяться или эволюционировать во времени, чистого RAG недостаточно. Нужна либо ретроспективная коррекция записей, либо явная модель идентичности с возможностью abstain. Иначе агент будет уверенно путать объекты — и вы потратите недели на отладку галлюцинаций, причина которых лежит не в модели, а в архитектуре памяти.

Источник: cs.AI updates on arXiv.org

новостиaiагентыllm
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​