• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Euronewsweek Media / Unsplash

RL с наградой за ответ учит модель угадывать, а не думать

Sh0ny
Sh0ny
3 августа 2026
  1. Главная
  2. Блог
  3. RL с наградой за ответ учит модель угадывать, а не думать
1 мин чтения

Коротко

Когда контекстное окно почти заполнено, outcome-reward RL толкает модель к преждевременному ответу вместо продолжения рассуждения. ThinkReset предлагает переиспользуемый промежуточный интерфейс — и это работает на нескольких бенчмарках.

Длинный chain-of-thought улучшает результаты на сложных задачах, но у него есть цена: накопление избыточности, переполнение контекста и якорение ошибок. Авторы ThinkReset указывают на проблему, которую часто упускают — и которая прямо противоречит популярному подходу к обучению reasoning-моделей.

Когда контекстное окно почти исчерпано, а задача ещё не решена, outcome-reward RL создаёт извращённый стимул. Модель получает награду за финальный ответ, а не за процесс — и вместо того, чтобы продолжать аккуратное рассуждение, она угадывает. Чем длиннее рассуждение, тем выше шанс, что окно закончится до ответа, и тем сильнее давление в сторону преждевременного «выстрела».

Авторы утверждают, что корневой bottleneck — не сжатие траектории и не управление во время инференса. Проблема в отсутствии переиспользуемого промежуточного интерфейса, который может заменить отброшенную историю и поддержать дальнейшее решение. По сути, нужен механизм, который сохраняет суть проделанной работы, освобождая контекст для продолжения.

ThinkReset реализует эту идею в текстовом пространстве через две операции: interface writeback (запись промежуточного результата) и reset (сброс контекста с сохранением интерфейса). Обучение напрямую оптимизирует успех продолжения после сброса — то есть модель учится не просто решать, а решать в условиях ограниченного окна с возможностью «перезагрузиться».

На нескольких бенчмарках long-horizon reasoning подход последовательно повышает success rate при фиксированных контекстных окнах. Это важный сигнал: архитектура reward-функции в RL для reasoning-моделей — не деталь, а фундаментальный выбор, который может работать против тебя.

Практический вывод для тех, кто строит агентов с длинными рассуждениями: если модель регулярно упирается в контекст и начинает угадывать, проблема может быть не в размере окна, а в том, что её учили оптимизировать финальный ответ любой ценой. Переиспользуемый интерфейс — это не оптимизация, а смена парадигмы работы с ограниченным контекстом.

Источник: cs.AI updates on arXiv.org

новостиaillmнейросети
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​