• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Brecht Corbeel / Unsplash

Где LLM «проседает» в рассуждениях: энергия слоёв предсказывает ошибки

Sh0ny
Sh0ny
4 августа 2026
  1. Главная
  2. Блог
  3. Где LLM «проседает» в рассуждениях: энергия слоёв предсказывает ошибки
1 мин чтения

Коротко

Новый метод SARE измеряет вычислительные затраты на каждом шаге chain-of-thought и показывает: неправильные траектории системно теряют энергию на развилках. Это даёт сигнал ошибки ещё до финального ответа.

Когда LLM рассуждает пошагово, не все шаги равны по вычислительной нагрузке. До сих пор интерпретируемость либо смотрела на финальный вывод, либо сжимала всю траекторию в одно число — теряя картину того, где именно модель «думает интенсивнее». Авторы SARE (Step-Aware Reasoning Energy) предлагают геометрический фреймворк, который измеряет усилие на уровне каждого отдельного шага chain-of-thought и связывает его с семантическим продвижением рассуждения.

Технически метод основан на Centered Kernel Alignment (CKA) между Gram-матрицами скрытых состояний токенов в соседних слоях трансформера. Это позволяет ловить межтокеновые реляционные структуры без выравнивания собственных векторов или соответствия кластеров — то есть без тяжёлых препроцессорских допущений. Поверх этого SARE моделирует CoT-траекторию как переходы между скрытыми семантическими состояниями, contextualizing энергию внутри логики рассуждения.

Проверка на шести reasoning-бенчмарках и трёх open-weight LLM даёт три наблюдения, которые стоит держать в голове:

  • Энергия рассуждения крайне неравномерна по типам шагов, с фазовыми переходами, невидимыми для trajectory-level метрик.
  • Неправильные траектории систематически показывают более низкую энергию на критических развилках — модель «проседает» именно там, где нужно больше всего думать.
  • SARE-фичи сопоставимы или превосходят output-based confidence-баслайны в большинстве настроек.

Практический вывод для тех, кто строит агентов и пайплайны на CoT: внутренняя геометрия слоёв содержит предиктивный сигнал, которого нет на поверхности текста. Если вы ловите ошибки только по выходному confidence или self-consistency, вы теряете ранний индикатор. SARE — это пока исследовательский фреймворк, а не готовая библиотека, но направление чёткое: следующий шаг — встраивание step-aware энергетических фич в runtime-мониторинг рассуждений, чтобы отлавливать сбойные ветки до того, как они породят действие.

Источник: cs.AI updates on arXiv.org

новостиaillmнейросети
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​