Коротко
Distribird превращает научную литературу в проверяемые априорные распределения для Bayesian-моделей. Его главное преимущество не в точности, а в трассируемости, локальной обработке и отказе от выдуманных ответов.
Самая полезная особенность Distribird — не то, что он строит лучшие априорные распределения. В исследовании система лишь сравнялась с обычным single-prompt LLM-подходом по качеству, зато показывает, откуда взялось каждое значение и когда не стоит отвечать вовсе.
Это важно для Bayesian-калибровки процессных моделей. На практике исследователи часто выбирают uniform prior не потому, что он научно оптимален, а потому что собирать обоснованный prior по публикациям долго и сложно.
Distribird автоматизирует этот рутинный участок: получает название параметра, его физическое описание и контекст предметной области, затем ищет статьи, извлекает из них значения, взвешивает их по релевантности и подбирает распределение через AIC model selection. Если данных в литературе нет, система использует неинформативную альтернативу и отдельно сообщает об уровне уверенности.
Проверка охватила 24 параметра в 10 научных областях и три open-weight-модели: Qwen3.6 27B, Gemma 4 31B и Mistral Small 4 119B. Но практическая ценность здесь в другом: каждый prior связан с конкретными статьями и исходными значениями, а встроенный validity layer умеет отклонять запросы вне области применимости.
Ограничения тоже существенные. Distribird рассчитан на модели с физически интерпретируемыми параметрами и предметной областью, представленной в опубликованной литературе. Если источников нет, он не извлекает внезапное знание, а возвращается к слабому неинформативному prior. Кроме того, в 11 из 30 случаев «модель–параметр» обычный single-prompt подход выдал уверенный, но необоснованный prior — то есть сама по себе хорошая формулировка ответа ещё не делает его пригодным для науки. Все вызовы языковых моделей выполняются локально; во внешние базы уходят только сгенерированные поисковые запросы.
Получается любопытный trade-off: Distribird не обещает магического роста точности, но добавляет то, чего обычно не хватает LLM-ответам, — проверяемую цепочку доказательств и право сказать «данных недостаточно». Для научных расчётов это может быть важнее небольшой прибавки к качеству точечной оценки.
Вы бы доверили априорное распределение системе, которая иногда отказывается отвечать, или предпочли бы более гладкий ответ без полной библиографии? Источник: cs.AI updates on arXiv.org