Коротко
Исследователи описали рассуждение языковой модели как накопление найденных подсказок и свели его к обычному дифференциальному уравнению. Это даёт способ изучать поведение модели статистически, но не объясняет, почему конкретная цепочка мыслей пошла именно по этому пути.
Главный результат этой работы не в том, что рассуждения LLM якобы удалось «разгадать». Исследователи нашли воспроизводимую закономерность на уровне множества цепочек рассуждений — и это важное, но гораздо более скромное утверждение.
Авторы представляют reasoning как поиск по графу подсказок. По мере генерации модель открывает новые «clue tokens» — токены, которые несут информацию для решения. Если смотреть не на одну цепочку, а усреднить много попыток на одном датасете, долю найденных подсказок удаётся описать одномерным обыкновенным дифференциальным уравнением.
Подсказки не размечаются вручную. Для этого используется normalized surprisal: насколько неожиданными для student LLM оказываются токены в ответах teacher LLM. Затем статистику собирают по множеству цепочек и проверяют, насколько она повторяется внутри того же набора данных.
И вот здесь появляется практическая ценность. Такой подход может дать исследователям измеримый язык для сравнения поведения моделей: не только «эта модель рассуждает лучше», а, например, как меняется темп обнаружения полезной информации в среднем. Это похоже скорее на приборную панель для анализа reasoning, чем на переводчик отдельных мыслей модели.
Но ограничения здесь принципиальные. Модель не объясняет содержание конкретной цепочки и не показывает, какая именно подсказка приведёт к правильному ответу в новом случае. Результат получен после усреднения многих рассуждений и воспроизводится в рамках одного датасета; из описания работы нельзя сделать вывод, что уравнение одинаково хорошо работает на других задачах или моделях. Кроме того, связь между surprisal и действительно полезной подсказкой остаётся операционным способом измерения, а не доказательством того, что модель «понимает» найденный clue.
Поэтому это интересный шаг к количественному изучению reasoning, но не теория внутреннего мышления LLM. Вы бы доверили такую усреднённую метрику при сравнении моделей, если она ничего не говорит о сбое в конкретном ответе? Источник: cs.CL updates on arXiv.org