Коротко
Production-система из arXiv показывает, что главный рычаг в построении knowledge graph — не модель, а пайплайн вокруг неё: живая онтология в промпте, шесть алгоритмов дедупликации без инференса и conflict guard, который не даст similarity-скор перетереть факт.
LLM извлекают сущности и отношения бегло, но нестабильно: типы дробятся, один человек всплывает под разными вариантами имени, отношения дублируются, а разных людей с одинаковым именем модель молча сливает в одного. Статья из arXiv описывает production-слой экстракции, который превращает живой поток документов в валидированный knowledge graph — и главный урок здесь не про модель, а про инженерию вокруг неё.
Система читает метаданные из Kafka, маршрутизирует PDF, таблицы, Office-файлы и изображения через формат-специфичные хендлеры, а экстракцию делает в два прохода локально размещённой Qwen3.5-9B, затюненной на онтологию. Но отличает её не модель, а онтология-гайдед промпт: релевантный слайс курированной онтологии извлекается live из графовой базы по embedding-сходству и инжектируется в промпт. Это снижает накладные расходы на каталог примерно на 94% относительно статических domain-слайсов. Проще говоря — вместо того чтобы пихать в контекст всю онтологию, система подтягивает только нужный кусок под каждый документ.
Дальше — пайплайн из пяти стадий: детерминированная очистка, мержинг между чанками, второй проход для отношений, шесть алгоритмов дедупликации без model inference и подсистема embedding-resolution с conflict guard. Последнее особенно важно: ни один similarity-скор не может перебить защиту от конфликта. Если метаданные говорят, что это разные люди — никакая близость эмбеддингов их не сольёт.
Результат на intelligence-корпусах: search recall поднялся с ~70% до ~95% при нулевых ложных слияниях. Попутно исправлены семь классов тихих дефектов — от бага, который обрезал исходный текст на один символ, до систематического дублирования сущностей с title-префиксами.
Практический вывод: в production-экстракции модель — не узкое место. Узкое место — дедупликация, разрешение конфликтов и подача правильного контекста в промпт. Шесть алгоритмов без инференса и conflict guard, который сильнее similarity-скора, — вот что превращает 70% в 95% без false merges. Если вы строите knowledge graph на LLM и упираетесь в качество, копать надо не в модель, а в пайплайн вокруг неё.
Источник: cs.AI updates on arXiv.org