• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Kevin Canlas / Unsplash

LLM пишут SHACL без синтаксических ошибок — но ошибаются в смысле

Sh0ny
Sh0ny
11 августа 2026
  1. Главная
  2. Блог
  3. LLM пишут SHACL без синтаксических ошибок — но ошибаются в смысле
1 мин чтения

Коротко

Новая проверка NL2SHACL показывает разрыв между валидным кодом и правильными ограничениями для RDF-графов. Это полезное напоминание: результат LLM нельзя принимать на веру только потому, что он успешно разбирается инструментом.

Самая опасная ошибка в генерации SHACL выглядит не как ошибка. Современные LLM уже хорошо создают синтаксически валидные shapes, но на сложных логических и структурных ограничениях часто не сохраняют исходный смысл требования.

SHACL используют, чтобы проверять, соответствует ли RDF knowledge graph заданным правилам. Проблема в том, что писать такие правила вручную умеют в основном технические специалисты, а доменные эксперты формулируют требования обычным языком.

Идея NL2SHACL звучит практично: описать условие словами и получить готовую схему. Но здесь нельзя ограничиться сравнением строк. Два shapes могут выглядеть и быть устроены по-разному, при этом задавать одно и то же ограничение. Поэтому новый NL2SHACL-Bench проверяет не только форму ответа, но и его семантическое соответствие исходному требованию.

Это важный сдвиг в оценке AI-инструментов. Если модель вернула документ, который проходит проверку парсера, это ещё не значит, что она поняла бизнес-правило. Для простых требований автоматизация уже выглядит многообещающе, а сложные условия всё ещё требуют независимой проверки смысла.

Ограничения исследования тоже стоит держать в голове: в abstract не названы четыре проверенные модели, их конкретные результаты и состав сложных тестовых случаев. Поэтому работа показывает проблему и предлагает основу для сравнения, но не отвечает, какая именно LLM лучше справляется с NL2SHACL.

Когда вы проверяете результат LLM в своей задаче, достаточно ли вам синтаксической валидности — или вы уже проверяете, что правило сохранило исходный смысл? Источник: cs.AI updates on arXiv.org

новостиaillmразработка
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​