Коротко
Главная проблема современных тестов на рассуждение может быть не в качестве моделей, а в том, что именно они измеряют. Авторы препринта предлагают вернуть в оценку ИИ проверяемые правила — и тем самым отделить реальное рассуждение от убедительной генерации ответа.
Если у «рассуждения» нет проверяемого определения, любой рост результатов можно принять за прогресс, хотя измерялось что-то другое. В этом и состоит главный тезис нового позиционного препринта: доверять оценкам автономного рассуждения нельзя, пока не понятны критерии их корректности.
Авторы предлагают описывать валидное и sound reasoning как обучаемый процесс, основанный на правилах. В такой рамке важен не сам факт, что модель выдала правдоподобный ответ, а возможность проверить, следуют ли выводы из исходных посылок и не нарушают ли они заданные правила.
Это возвращает в разговор о больших моделях идеи, которые исторически связывали с логикой и верифицируемым автоматизированным рассуждением. Генеративные модели заметно продвинули практическую сторону ИИ, но удобство формулировки ответа ещё не доказывает наличие рассуждения в строгом смысле.
Практическая часть работы — операциональные определения и чек-лист для авторов исследований. Если такой подход приживётся, сравнивать системы станет проще: нужно будет оценивать не только итоговый ответ, но и корректность процесса, который к нему привёл.
Ограничение здесь существенное: это позиционная работа, а не новый эксперимент с результатами конкретной модели. Авторы сами указывают, что сообщество пока не пришло к единому рабочему определению reasoning и нередко не учитывает классические подходы из логики. Поэтому предложенная рамка — полезная заявка на стандарт, но ещё не доказательство того, что её критерии будут приняты или полностью решат проблему оценки.
Когда вы видите высокий результат языковой модели на тесте «на рассуждение», что для вас важнее: правильный ответ или возможность проверить каждый шаг его получения? Источник: cs.AI updates on arXiv.org