Коротко
Когда контекстное окно почти заполнено, outcome-reward RL толкает модель к преждевременному ответу вместо продолжения рассуждения. ThinkReset предлагает переиспользуемый промежуточный интерфейс — и это работает на нескольких бенчмарках.
Длинный chain-of-thought улучшает результаты на сложных задачах, но у него есть цена: накопление избыточности, переполнение контекста и якорение ошибок. Авторы ThinkReset указывают на проблему, которую часто упускают — и которая прямо противоречит популярному подходу к обучению reasoning-моделей.
Когда контекстное окно почти исчерпано, а задача ещё не решена, outcome-reward RL создаёт извращённый стимул. Модель получает награду за финальный ответ, а не за процесс — и вместо того, чтобы продолжать аккуратное рассуждение, она угадывает. Чем длиннее рассуждение, тем выше шанс, что окно закончится до ответа, и тем сильнее давление в сторону преждевременного «выстрела».
Авторы утверждают, что корневой bottleneck — не сжатие траектории и не управление во время инференса. Проблема в отсутствии переиспользуемого промежуточного интерфейса, который может заменить отброшенную историю и поддержать дальнейшее решение. По сути, нужен механизм, который сохраняет суть проделанной работы, освобождая контекст для продолжения.
ThinkReset реализует эту идею в текстовом пространстве через две операции: interface writeback (запись промежуточного результата) и reset (сброс контекста с сохранением интерфейса). Обучение напрямую оптимизирует успех продолжения после сброса — то есть модель учится не просто решать, а решать в условиях ограниченного окна с возможностью «перезагрузиться».
На нескольких бенчмарках long-horizon reasoning подход последовательно повышает success rate при фиксированных контекстных окнах. Это важный сигнал: архитектура reward-функции в RL для reasoning-моделей — не деталь, а фундаментальный выбор, который может работать против тебя.
Практический вывод для тех, кто строит агентов с длинными рассуждениями: если модель регулярно упирается в контекст и начинает угадывать, проблема может быть не в размере окна, а в том, что её учили оптимизировать финальный ответ любой ценой. Переиспользуемый интерфейс — это не оптимизация, а смена парадигмы работы с ограниченным контекстом.
Источник: cs.AI updates on arXiv.org