• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Pepi Stojanovski / Unsplash

Почему LLM проваливают промпты с большим числом требований

Sh0ny
Sh0ny
14 августа 2026
  1. Главная
  2. Блог
  3. Почему LLM проваливают промпты с большим числом требований
2 мин чтения

Коротко

Модель может неплохо выполнять каждое требование по отдельности, но проваливать их комбинацию. Исследование показывает, почему длинный список инструкций лучше разделять на этапы и проверять автоматически.

Проблема сложных промптов не в том, что языковая модель «не понимает» отдельные инструкции. Она теряет надёжность, когда должна выполнить много требований одновременно: соблюсти структуру, формат, ограничения безопасности и детали содержания.

В исследовании проверили 15 моделей на 36 типах ограничений — всего 369 753 проверки. Для оценки использовали процедурно сгенерированные задания и детерминированный проверяющий код, без участия LLM-судьи.

Главный результат неприятен для привычного подхода к промптам. При добавлении требований качество каждого отдельного ограничения снижается постепенно. Но вероятность выполнить все ограничения сразу обрушивается гораздо быстрее: при восьми требованиях модель проходила каждое из них примерно в 41% случаев, а все восемь одновременно — только в 5,7%.

Это важное различие. Среднее качество по отдельным пунктам может выглядеть терпимо, хотя готовый ответ почти всегда нарушает хотя бы одно условие. Ошибки при этом в основном почти независимы, поэтому накапливаются мультипликативно. Иногда причина проще: одна ошибочная особенность ответа, например неверное число предложений, сразу ломает несколько проверок, которые на неё опираются.

Требования тоже неравноценны. Структурные ограничения — например, связанные с поддержанием формы ответа и последовательности — теряют исходную способность модели примерно вдвое быстрее, чем лексические. Бинарное условие вроде наличия конкретного слова легче удержать, чем набор правил, требующий постоянно отслеживать структуру и контекст.

Отсюда практический вывод: длинный промпт с десятью пунктами — это не одна задача, а связка независимых рисков. Надёжнее разделить работу на несколько шагов: сначала получить содержание, затем преобразовать его в нужную структуру, после этого прогнать результат через отдельные проверки. Это не делает модель умнее, но не заставляет её удерживать все ограничения в одном проходе.

Есть и ограничения у самого результата. Тест охватывает 15 моделей и от одного до 12 одновременных требований, а все проверки построены процедурно. Исследование показывает общий эффект, но не говорит, какая конкретная модель лучше подходит для вашего промпта. Кроме того, порог зависит от типа ограничений: у самой сильной модели успех на уровне отдельных заданий опускается ниже 50% уже при семи требованиях, а у 12 из 15 моделей — при трёх или меньшем числе.

Если ваши промпты регулярно содержат больше пяти-шести обязательных условий, вы сначала разбиваете их на этапы или всё ещё рассчитываете на один идеальный ответ? Источник: cs.AI updates on arXiv.org

новостиaillmразработка
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​