Коротко
Новый метод SARE измеряет вычислительные затраты на каждом шаге chain-of-thought и показывает: неправильные траектории системно теряют энергию на развилках. Это даёт сигнал ошибки ещё до финального ответа.
Когда LLM рассуждает пошагово, не все шаги равны по вычислительной нагрузке. До сих пор интерпретируемость либо смотрела на финальный вывод, либо сжимала всю траекторию в одно число — теряя картину того, где именно модель «думает интенсивнее». Авторы SARE (Step-Aware Reasoning Energy) предлагают геометрический фреймворк, который измеряет усилие на уровне каждого отдельного шага chain-of-thought и связывает его с семантическим продвижением рассуждения.
Технически метод основан на Centered Kernel Alignment (CKA) между Gram-матрицами скрытых состояний токенов в соседних слоях трансформера. Это позволяет ловить межтокеновые реляционные структуры без выравнивания собственных векторов или соответствия кластеров — то есть без тяжёлых препроцессорских допущений. Поверх этого SARE моделирует CoT-траекторию как переходы между скрытыми семантическими состояниями, contextualizing энергию внутри логики рассуждения.
Проверка на шести reasoning-бенчмарках и трёх open-weight LLM даёт три наблюдения, которые стоит держать в голове:
Практический вывод для тех, кто строит агентов и пайплайны на CoT: внутренняя геометрия слоёв содержит предиктивный сигнал, которого нет на поверхности текста. Если вы ловите ошибки только по выходному confidence или self-consistency, вы теряете ранний индикатор. SARE — это пока исследовательский фреймворк, а не готовая библиотека, но направление чёткое: следующий шаг — встраивание step-aware энергетических фич в runtime-мониторинг рассуждений, чтобы отлавливать сбойные ветки до того, как они породят действие.
Источник: cs.AI updates on arXiv.org