Коротко
Фреймворк Crystalis обходит агентный кодинг в 9 раз на задаче генерации связанных визуализаций. Разбор, почему декомпозиция бьёт end-to-end подход, когда компоненты жёстко связаны.
LLM отлично рисуют отдельные графики, но связные multi-view визуализации — там, где виды обмениваются данными и реагируют на взаимодействия друг друга — остаются для них камнем преткновения. Причина не в качестве модели, а в том, что ошибка в одном компоненте тихо ломает остальные, и end-to-end агент не успевает это отловить. Бумажка Crystalis показывает, что структурированная декомпозиция решает проблему радикально: 75% end-to-end успеха против 8.3% у агента на той же модели. Девятикратный разрыв — не магия промпта, а следствие архитектурного выбора. Crystalis не пытается выжать из LLM аналитическое качество, которое зависит от доменных знаний и экспертизы пользователя. Вместо этого авторы ставят вопрос фундаментальнее: может ли модель хотя бы структурно корректно собрать CMV, и какие абстракции для этого нужны. Ответ — query-центричная модель, где визуализация разбивается на структурированные запросы над графом зависимостей. Граф покрывает три типа компонентов (Data, Visualization, Interaction) и три уровня абстракции (requirement, specification, executable object). Поверх этой структуры работают два механизма. Progressive nucleation собирает каждый запрос вертикально — от требования к исполняемому объекту — в порядке зависимостей. Semantic annealing проверяет горизонтальную консистентность между запросами на каждом уровне через слоистые логические проверки. По сути — сборка по слоям с контрольными точками, а не одна большая генерация. Бенчмарк — 12 задач, пять frontier-моделей. Результат: до 75% end-to-end успеха. Агентный кодинг-базлайн на той же модели — 8.3%. Пользовательское исследование с 12 практиками подтверждает, что декомпозиция и итеративная доработка удобны в работе. Вывод для практиков очевиден: когда компоненты системы жёстко связаны и ошибка в одном каскадом ломает остальные, end-to-end агент — не лучший выбор. Структурированная декомпозиция с явным графом зависимостей и послойной валидацией работает на порядок лучше. Вопрос, который остаётся открытым: масштабируется ли этот подход за пределы визуализаций — на произвольные multi-component системы, где coupling между частями высокий.
Источник: cs.AI updates on arXiv.org