Коротко
Исследователи сравнили три способа дать языковой модели доступ к причинным связям внутри симулятора очистных сооружений. Максимальную точность показал живой доступ к симулятору, но переносимый ретривер оказался полезнее там, где нужно оценивать последствия вмешательств и переходить между установками.
В промышленной задаче модель может ответить правильно в лабораторном тесте и всё равно оказаться неудобной для реального предприятия. В этой работе лучший результат — 99,5% — дал прямой доступ к работающему симулятору, но наиболее практичным компромиссом выглядит другой подход.
Задача была не в том, чтобы модель пересказала общие сведения об очистке сточных вод. Ей нужно было объяснить, почему растёт N2O, или предсказать, что произойдёт после снижения аэрации на 20% — с учётом взаимосвязей переменных и скорости распространения эффекта.
Исследователи оставили Qwen2.5-32B-Instruct замороженной и сравнили три способа заземлить её ответы в симуляторе CCSS-IX:
Для сравнения, лучший retrieval-augmented baseline набрал 48%. На первый взгляд вывод очевиден: подключаем симулятор напрямую и получаем почти идеальный результат. Но такой вариант требует доступного и корректно настроенного симулятора. Если его нет под рукой, высокий балл превращается в демонстрацию возможностей, а не в переносимое решение.
DRR набрал меньше на исходном тесте, зато после переноса на биологически отличающуюся установку сохранил 88%. Статическая таблица параметров перенос не пережила. Это важное различие: промышленная система меняется от площадки к площадке, и универсальность здесь может быть ценнее нескольких дополнительных процентов на знакомых данных.
Ещё интереснее результат на 60 контрфактических вопросах — то есть на вопросах о последствиях вмешательства. Только Method 3 справился с запросами такого типа; он превзошёл Method 2 на 16,3 процентного пункта с 95%-м доверительным интервалом от 7,1 до 26,4 пункта. В категориях, связанных с временным масштабом и режимом работы, DRR получил 100%.
Авторы проверили идею и вне очистки сточных вод: на ARC с корпусом фактов OpenBookQA селективный ретривер набрал 79% против 76% у Llama-3.1-8B без ограничений и 74% при полной инъекции данных. Это не доказывает универсальность метода, но показывает, что выигрыш не обязательно связан только с конкретным симулятором.
Ограничения тоже существенные. Живой симулятор требует инфраструктуры, статическая таблица не переносится между установками, а DRR — это отдельная модель на 110 млн параметров, которую обучают под каждую площадку примерно за 17 секунд. Кроме того, результаты получены на бенчмарках из 198 и 60 вопросов, а не в описанном полевом испытании на реальных операторах.
Мой вывод простой: для промышленного AI не стоит выбирать решение только по максимальной точности. Если модель должна отвечать на вопросы «что будет, если…» и работать на разных объектах, чуть менее точный, но переносимый слой извлечения параметров может оказаться полезнее прямого доступа к идеальному симулятору.
В вашей задаче вы бы выбрали максимальную точность на одной площадке или более слабую модель, которая переносится на другие? Источник: cs.CL updates on arXiv.org