Коротко
Препринт MCTS-Report превращает генерацию отчёта с графиками в поиск по вариантам, а не в линейную цепочку вызовов LLM. Разбираем, как SQL-проверки, оценка графиков и контроль повторов пытаются исправить главную проблему таких систем: убедительный текст может быть фактически неверным.
Генерация отчёта по таблице обычно выглядит как конвейер: модель планирует текст, строит графики, формулирует выводы. Такой подход удобен для прототипа, но плохо отвечает на простой вопрос: что делать, если красивый график противоречит цифрам в таблице, а текст уверенно объясняет ошибочный вывод?
Препринт MCTS-Report предлагает не писать отчёт за один проход, а собирать его через Monte Carlo Tree Search. Система рассматривает генерацию как последовательность действий: спланировать главы, определить задачи для визуализации, построить график, организовать инсайты и отредактировать повествование. После каждого шага у неё есть текущее состояние отчёта, от которого зависят следующие решения.
Это важный сдвиг в архитектуре. LLM здесь не просто выдаёт финальный ответ, а участвует в исследовании пространства вариантов. Траектория рассуждений сохраняется в узлах дерева, поэтому последующие действия получают контекст уже созданного отчёта, а не только исходную таблицу.
Но сам поиск не решает проблему автоматически. Его качество определяется тем, как система оценивает промежуточные результаты. Авторы используют составную функцию награды: проверяют числовые факты через SQL, отдельно оценивают качество графика, соответствие графика тексту и полноту структуры. Дополнительно вводятся штраф за повторяющиеся графики и проверки предусловий, чтобы отсекать недопустимые действия.
Именно здесь находится наиболее практичная идея работы: для аналитических отчётов недостаточно оценивать «понятность» текста. Нужны независимые сигналы качества, которые ловят разные классы ошибок. SQL может проверить число, но не скажет, удачно ли выбран тип визуализации. Оценка графика не гарантирует, что абзац действительно описывает его. Разделение критериев позволяет искать компромисс, а не маскировать все проблемы одной итоговой оценкой.
Для проверки авторы собрали MMRBench — набор реальных таблиц из шести доменов с эталонными структурами отчётов и проверяемыми ключевыми выводами. В экспериментах MCTS-Report получил общий результат 77,9 и превзошёл заявленные сильные базовые методы по структурной полноте, числовой точности, соответствию графиков тексту и новизне инсайтов.
К этой цифре стоит относиться без лишнего энтузиазма: в доступном описании нет деталей о составе базовых методов, разбросе результатов и вкладе отдельных компонентов системы. Поэтому 77,9 — аргумент в пользу направления, но не доказательство, что любой аналитический отчёт теперь лучше строить через MCTS.
Практический вывод другой. Если вы проектируете агента для работы с данными, полезнее начинать не с промпта «сделай красивый отчёт», а с дерева допустимых действий и проверок после каждого из них. Такой агент сложнее и, вероятно, дороже линейного пайплайна, зато его ошибки можно диагностировать: неверное число, плохой график, повтор визуализации или разрыв между картинкой и текстом — это разные сбои, для которых нужны разные проверки.
Источник: cs.AI updates on arXiv.org