Коротко
Исследователи показали, что агенту не всегда нужна новая модель: иногда достаточно сохранить удачные протоколы и границы прошлых ошибок. Такой подход превращает опыт одного запуска в переносимый рабочий актив для следующих моделей и задач.
Главный результат этой работы не в том, что GPT-5.2 стал умнее. Почти двукратный рост успеха в задачах по материаловедению получили без обновления параметров модели — за счёт памяти, которая сохраняет не только ответы, но и рабочие навыки, предупреждения и проверки.
Это важный сдвиг в подходе к AI-агентам. Обычно опыт живёт в разрозненных ноутбуках, логах запусков и головах отдельных исследователей. Здесь его предлагают хранить как проверяемые факты и исполняемые навыки: что сработало, где метод ломается, какой протокол использовать и как проверить результат.
Самый наглядный пример — расчёты уравнения состояния твёрдых элементов. Агент раньше повторял ошибку и сталкивался с проблемой инициализации волновой функции уже во время выполнения. Память превратила этот опыт в проверку до запуска: результаты изменились с 22/1/4 до 25/2/0 по категориям «правильно/частично/ошибка», а 92% повторных ошибок удалось избежать.
В 49 реальных вопросах по работе с инструментами для материаловедения, включавших 138 исполняемых подзадач, память почти удвоила успешность GPT-5.2. В 13 практических сценариях моделирования к третьему раунду она вдвое сократила объём трассировки в токенах и более чем в два раза уменьшила число вызовов инструментов, сохранив физически осмысленные результаты для расчётов band gap, фононов, вакансий и work function.
Но граница вывода здесь существенная. Речь идёт о трёх вычислительных сценариях, а не о доказательстве, что такая память уже создаёт универсального автономного партнёра для лаборатории. Кроме того, по одному абстракту не видно, насколько сложно проверять, исправлять и переносить накопленные факты между разными моделями на практике.
Зато практическая идея выглядит крепкой: полезнее сохранять не длинную историю диалогов, а структурированный опыт — включая неудачи и условия, при которых метод нельзя применять. Если такой слой памяти действительно переносим, ценность AI-системы начинает зависеть не только от выбранной модели, но и от того, чему она уже научилась в конкретной рабочей среде.
Если бы вы внедряли такого агента у себя, что было бы ценнее сохранять в первую очередь: удачные инструкции или каталог повторяющихся ошибок? Источник: cs.AI updates on arXiv.org