Коротко
Новая работа на arXiv предлагает смотреть на галлюцинации не только как на ошибки, но и как на попытку выдать единственную интерпретацию там, где её нельзя обосновать. Этот взгляд помогает отличать нехватку знаний от задачи с несколькими допустимыми ответами.
Главная проблема LLM может быть не в том, что модель плохо рассуждает, а в том, что от неё требуют один ответ там, где структура задачи его не гарантирует. Работа на arXiv формализует этот конфликт и связывает его с тем, что авторы называют неподдержанной канонизацией — превращением множества допустимых выводов в один без достаточного основания.
Авторы разделяют три уровня «однозначности». Сначала выводы могут стабилизироваться для конкретного исходного набора данных. Затем — совпадать независимо от стартовой точки. И только на третьем уровне появляется единственная допустимая интерпретация.
Это важное различие для LLM. Стабильный ответ ещё не означает правильный или единственно возможный ответ. Если исходные данные неполны, возникает эпистемическая множественность: истина, возможно, одна, но системе не хватает информации. В другом случае множественность структурная: несколько интерпретаций согласуются с правилами одновременно.
Отсюда практический вывод: режим «всегда отвечай уверенно и однозначно» может быть не признаком хорошего reasoning, а источником галлюцинаций. Для одних задач нужен оператор, который постепенно замыкает систему выводов. Для других — явный селектор, который выбирает вариант по дополнительному критерию. Но такой выбор нельзя выдавать за следствие самих исходных правил.
Ограничения у работы существенные. Для эпистемически множественных теорий авторы показывают стабилизацию замыкания, но полная детерминизация зависит от глобального свойства сходимости, которое остаётся открытым. Для специального класса структурно множественных теорий, где нет общих верхних границ, детерминизация достигается каноническим выбором. Это формальная рамка, а не экспериментальное сравнение LLM, поэтому она пока не говорит, как именно измерять галлюцинации в конкретной модели.
При проверке ответа LLM вы сначала ищете ошибку в фактах или допускаете, что сама задача может иметь несколько корректных решений? Источник: cs.AI updates on arXiv.org