Коротко
Оценка фактов у LLM упирается в конфликт: чем мельче утверждение, тем легче его проверить, но тем больше риск потерять смысл. TriQua предлагает сохранять контекст через дополнительные квалификаторы и отмечать ошибку на конкретном элементе факта.
Главная проблема проверки фактов у LLM не в том, чтобы найти ошибочное предложение. Сложнее разложить его так, чтобы проверка была точной и при этом не потеряла важный контекст.
Обычно используют подход «сначала разложить, потом проверить». Простые утверждения превращают в тройки вида «объект — отношение — значение». Это удобно для поиска доказательств, но иногда из фразы исчезают условия, время, место или другие детали, без которых она меняет смысл.
TriQua предлагает не выбирать между атомарностью и контекстом. Простые утверждения остаются обычными тройками, а сложные получают дополнительные квалификаторы — контекст, прикреплённый к конкретной части факта. В итоге система может проверять небольшие элементы, не вырывая их из исходного смысла.
Практическая ценность здесь не только в итоговой оценке factuality. Процесс верификации должен указывать, какая именно тройка или какой квалификатор содержит ошибку. Для отладки ответов это заметно полезнее, чем общий ярлык «предложение недостоверно»: становится понятнее, что исправлять — сам факт или его контекст.
Авторы также предлагают TriQuaScore для количественной оценки таких структурированных фактов и сообщают, что он хорошо согласуется с человеческими оценками. По их данным, TriQua показывает устойчивое качество декомпозиции и превосходит существующие подходы в проверке фактов по доказательствам.
Но пока это описание уровня исследовательского анонса. В нём нет подробностей о наборах данных, стоимости такой декомпозиции, скорости проверки и случаях, где квалификаторы сами могут быть выделены неверно. Поэтому TriQua выглядит не как готовое решение проблемы галлюцинаций, а как более аккуратный способ измерять и объяснять ошибки.
Если проверка ответа требует сохранять всё больше контекста, где для вас проходит граница между полезной точностью и слишком дорогой сложностью? Источник: cs.AI updates on arXiv.org