• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Carlos Muza / Unsplash

Память LLM-агентов теряет предпочтения после важных событий

Sh0ny
Sh0ny
6 августа 2026
  1. Главная
  2. Блог
  3. Память LLM-агентов теряет предпочтения после важных событий
2 мин чтения

Коротко

FinPerMA проверяет не просто способность агента вспомнить факт, а умеет ли он обновить модель пользователя после значимого события. Результат неприятный: даже сильные модели часто сохраняют детали, но теряют то, что нужно для персонального решения.

LLM-агенты пока плохо справляются с задачей, ради которой им вообще нужна долговременная память: понять, что предпочтения пользователя изменились. В benchmark FinPerMA после значимых событий даже простое извлечение релевантных записей иногда работает лучше специализированных систем памяти.

Это важное различие. Запомнить, что пользователь владеет определённым активом, проще, чем вывести из нового события, как теперь следует изменить его профиль и рекомендации. В финансовом консультировании такая ошибка опаснее обычного провала в вопросах на запоминание: агент может помнить правильные факты, но использовать их уже неуместно.

Что именно проверяет FinPerMA

Авторы построили тест на замороженных продольных траекториях инвесторов. В них есть персональные данные, события и контрольная точка Post-Shock — момент, когда нужно проверить, встроил ли агент материальное событие в постоянную модель пользователя.

Генерация сочетает детерминированные правила, основанные на теории, контролируемое повествование LLM и автоматическую проверку качества. Это делает тест менее зависимым от случайных, слабо ограниченных траекторий, которые часто используются в подобных оценках.

Масштаб эксперимента — 2 994 вопроса и 276 персон. Авторы проверили семь frontier-моделей и до семи конфигураций памяти. Ни одна конфигурация с полным контекстом не превысила примерно 0,47 общей точности, а на вопросах с вариантами ответа результат остался около 39%.

Главный провал — не в фактах

Анализ атрибуции показывает, что суммаризация часто сохраняет фактические детали, но выбрасывает сигналы предпочтений. Для обычного чат-бота это может выглядеть как успешное сжатие истории. Для персонального агента — как потеря самого важного слоя контекста.

Простое retrieval-извлечение поэтому может обгонять специально спроектированные системы памяти. После «шоковых» событий разрыв увеличивается: агенту недостаточно найти старую запись, нужно понять, какие части пользовательской модели теперь устарели, а какие — нет.

Практический вывод для разработчиков довольно приземлённый: память агента нельзя оценивать только по тому, насколько хорошо он отвечает на вопросы о прошлом. Нужны сценарии, где пользовательская модель должна обновиться после события, а результат — проверяться на устойчивость через некоторое время.

FinPerMA не доказывает, что конкретная архитектура памяти всегда хуже retrieval. Но он хорошо показывает слабое место текущих подходов: они оптимизируют сохранение контекста, хотя персонализация требует ещё и управляемого пересмотра выводов. Пока это не решено, «долговременная память» агента остаётся скорее архивом, чем моделью пользователя.

Источник: cs.AI updates on arXiv.org

новостиaillmагенты
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​