• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Roman Budnikov / Unsplash

У рассуждений LLM нашли закономерность — но не для каждой цепочки

Sh0ny
Sh0ny
8 августа 2026
  1. Главная
  2. Блог
  3. У рассуждений LLM нашли закономерность — но не для каждой цепочки
1 мин чтения

Коротко

Исследователи описали рассуждение языковой модели как накопление найденных подсказок и свели его к обычному дифференциальному уравнению. Это даёт способ изучать поведение модели статистически, но не объясняет, почему конкретная цепочка мыслей пошла именно по этому пути.

Главный результат этой работы не в том, что рассуждения LLM якобы удалось «разгадать». Исследователи нашли воспроизводимую закономерность на уровне множества цепочек рассуждений — и это важное, но гораздо более скромное утверждение.

Авторы представляют reasoning как поиск по графу подсказок. По мере генерации модель открывает новые «clue tokens» — токены, которые несут информацию для решения. Если смотреть не на одну цепочку, а усреднить много попыток на одном датасете, долю найденных подсказок удаётся описать одномерным обыкновенным дифференциальным уравнением.

Подсказки не размечаются вручную. Для этого используется normalized surprisal: насколько неожиданными для student LLM оказываются токены в ответах teacher LLM. Затем статистику собирают по множеству цепочек и проверяют, насколько она повторяется внутри того же набора данных.

И вот здесь появляется практическая ценность. Такой подход может дать исследователям измеримый язык для сравнения поведения моделей: не только «эта модель рассуждает лучше», а, например, как меняется темп обнаружения полезной информации в среднем. Это похоже скорее на приборную панель для анализа reasoning, чем на переводчик отдельных мыслей модели.

Но ограничения здесь принципиальные. Модель не объясняет содержание конкретной цепочки и не показывает, какая именно подсказка приведёт к правильному ответу в новом случае. Результат получен после усреднения многих рассуждений и воспроизводится в рамках одного датасета; из описания работы нельзя сделать вывод, что уравнение одинаково хорошо работает на других задачах или моделях. Кроме того, связь между surprisal и действительно полезной подсказкой остаётся операционным способом измерения, а не доказательством того, что модель «понимает» найденный clue.

Поэтому это интересный шаг к количественному изучению reasoning, но не теория внутреннего мышления LLM. Вы бы доверили такую усреднённую метрику при сравнении моделей, если она ничего не говорит о сбое в конкретном ответе? Источник: cs.CL updates on arXiv.org

новостиllmaiнаука
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​