Коротко
Все проверяют память на момент записи. Но факт может быть записан идеально и перестать быть верным, потому что мир сдвинулся. Проект ANAMNESIS попытался предсказывать гниение памяти — и модель нашла лазейку вместо решения.
Когда говорят о проблемах памяти у LLM-агентов, обычно имеют в виду галлюцинацию при записи: модель-distiller выдумывает факт, которого не было в разговоре. Это известно, для этого есть бенчмарки (HaluMem), для этого строят write-time гейты. Но есть вторая проблема, которую почти никто не трогает: факт записан perfectly и всё равно становится ложным. Вы переехали. Сменили работу. Продали ноутбук. Ничего не атаковано, ничего не галлюцинировано — мир просто двинулся, а память нет. Автор проекта ANAMNESIS столкнулся с этим лично: сказал ассистенту, что перешёл на MacBook, консолидация записала новый факт за тринадцать секунд до следующего вопроса, ретривал подтянул его в контекст — ответ всё равно сказал ThinkPad. Ни один компонент не сломался. Просто ни у одного компонента не было задачи заметить, что старый факт устарел. ANAMNESIS — локальная система памяти для долгих разговоров с LLM, построенная вокруг трёх механизмов. GATE проверяет, поддерживался ли факт источником на момент записи (не новинка — ProMem сделал это раньше). PREDICT пытается forecast: испортится ли конкретная чистая память в ближайшие N ходов. HEAL — ремонт по триггеру прогноза. Именно PREDICT — единственный по-настоящему новый кусок, и именно он пока не работает. Форкастер обучили end-to-end за три секунды на CPU, без единого доллара затрат. Forward AUROC на строго отложенном сплите — 0.665. Это значит: даны две памяти, одна испортится, другая нет — модель ранжирует правильно примерно два раза из трёх. Лучше случайности, далеко до пользы. Логистическая регрессия на тех же фичах дала 0.6647. Градиентный бустинг обошёл простейший baseline на 0.0007 — это ничья. Но самое ценное обнаружилось не в метриках, а при проверке обученной модели против живой схемы базы. Доминантная фича несла 76,8% gains модели — и это была аннотация датасета, которая в продакшене является захардкоженной константой. Модель нашла shortcut, как модели и делают, когда продакшен-фичи остаются незаполненными. Calibration score выглядел безупречно (ECE 0.00012), пока не построили reliability diagram — все предсказания сидели в одном бакете. Модель, которая говорит одно и то же обо всём, тривиально калибрирована и не несёт информации. Три вывода, которые обобщаются за рамки проекта. Первый: очевидная фича может быть неправильной. Инстинкт — брать embedding distance и искать выбросы. Но атака MINJA показывает, что отравленные памяти,植入 через обычный разговор, сидят вперемешку с benign в embedding space, потому что атака работает через blending. Детектор на этой геометрии слеп к единственной атаке, которую ему нужно ловить. Поэтому фичи здесь — поведенческие и структурные, без embedding distance вовсе. Второй: скалярная метрика может быть обманута вырожденной моделью. Calibration number был отличным и бессмысленным. Любой скаляр может скрыть модель, выучившую говорить одно — диаграмма за ним не может. Третий: выгрузить данные в таблицу и посмотреть на них — сильнее, чем читать код. Два реальных бага в проекте найдены так, а не чтением исходников: shortcut-learning и string mismatch, который молча занулил три фичи в 14 823 строках. Проект — рабочий документ финального года, не готовая статья. Результаты scored pending, автоматический HEAL — v2 workstream. Но честность отчёта ценнее, чем число, которое могло бы выглядеть лучше. Источник: Hacker News — ANAMNESIS
Источник: Hacker News - Newest: ""AI" "LLM""