Коротко
FinPerMA проверяет не просто способность агента вспомнить факт, а умеет ли он обновить модель пользователя после значимого события. Результат неприятный: даже сильные модели часто сохраняют детали, но теряют то, что нужно для персонального решения.
LLM-агенты пока плохо справляются с задачей, ради которой им вообще нужна долговременная память: понять, что предпочтения пользователя изменились. В benchmark FinPerMA после значимых событий даже простое извлечение релевантных записей иногда работает лучше специализированных систем памяти.
Это важное различие. Запомнить, что пользователь владеет определённым активом, проще, чем вывести из нового события, как теперь следует изменить его профиль и рекомендации. В финансовом консультировании такая ошибка опаснее обычного провала в вопросах на запоминание: агент может помнить правильные факты, но использовать их уже неуместно.
Авторы построили тест на замороженных продольных траекториях инвесторов. В них есть персональные данные, события и контрольная точка Post-Shock — момент, когда нужно проверить, встроил ли агент материальное событие в постоянную модель пользователя.
Генерация сочетает детерминированные правила, основанные на теории, контролируемое повествование LLM и автоматическую проверку качества. Это делает тест менее зависимым от случайных, слабо ограниченных траекторий, которые часто используются в подобных оценках.
Масштаб эксперимента — 2 994 вопроса и 276 персон. Авторы проверили семь frontier-моделей и до семи конфигураций памяти. Ни одна конфигурация с полным контекстом не превысила примерно 0,47 общей точности, а на вопросах с вариантами ответа результат остался около 39%.
Анализ атрибуции показывает, что суммаризация часто сохраняет фактические детали, но выбрасывает сигналы предпочтений. Для обычного чат-бота это может выглядеть как успешное сжатие истории. Для персонального агента — как потеря самого важного слоя контекста.
Простое retrieval-извлечение поэтому может обгонять специально спроектированные системы памяти. После «шоковых» событий разрыв увеличивается: агенту недостаточно найти старую запись, нужно понять, какие части пользовательской модели теперь устарели, а какие — нет.
Практический вывод для разработчиков довольно приземлённый: память агента нельзя оценивать только по тому, насколько хорошо он отвечает на вопросы о прошлом. Нужны сценарии, где пользовательская модель должна обновиться после события, а результат — проверяться на устойчивость через некоторое время.
FinPerMA не доказывает, что конкретная архитектура памяти всегда хуже retrieval. Но он хорошо показывает слабое место текущих подходов: они оптимизируют сохранение контекста, хотя персонализация требует ещё и управляемого пересмотра выводов. Пока это не решено, «долговременная память» агента остаётся скорее архивом, чем моделью пользователя.
Источник: cs.AI updates on arXiv.org