Коротко
Модель может неплохо выполнять каждое требование по отдельности, но проваливать их комбинацию. Исследование показывает, почему длинный список инструкций лучше разделять на этапы и проверять автоматически.
Проблема сложных промптов не в том, что языковая модель «не понимает» отдельные инструкции. Она теряет надёжность, когда должна выполнить много требований одновременно: соблюсти структуру, формат, ограничения безопасности и детали содержания.
В исследовании проверили 15 моделей на 36 типах ограничений — всего 369 753 проверки. Для оценки использовали процедурно сгенерированные задания и детерминированный проверяющий код, без участия LLM-судьи.
Главный результат неприятен для привычного подхода к промптам. При добавлении требований качество каждого отдельного ограничения снижается постепенно. Но вероятность выполнить все ограничения сразу обрушивается гораздо быстрее: при восьми требованиях модель проходила каждое из них примерно в 41% случаев, а все восемь одновременно — только в 5,7%.
Это важное различие. Среднее качество по отдельным пунктам может выглядеть терпимо, хотя готовый ответ почти всегда нарушает хотя бы одно условие. Ошибки при этом в основном почти независимы, поэтому накапливаются мультипликативно. Иногда причина проще: одна ошибочная особенность ответа, например неверное число предложений, сразу ломает несколько проверок, которые на неё опираются.
Требования тоже неравноценны. Структурные ограничения — например, связанные с поддержанием формы ответа и последовательности — теряют исходную способность модели примерно вдвое быстрее, чем лексические. Бинарное условие вроде наличия конкретного слова легче удержать, чем набор правил, требующий постоянно отслеживать структуру и контекст.
Отсюда практический вывод: длинный промпт с десятью пунктами — это не одна задача, а связка независимых рисков. Надёжнее разделить работу на несколько шагов: сначала получить содержание, затем преобразовать его в нужную структуру, после этого прогнать результат через отдельные проверки. Это не делает модель умнее, но не заставляет её удерживать все ограничения в одном проходе.
Есть и ограничения у самого результата. Тест охватывает 15 моделей и от одного до 12 одновременных требований, а все проверки построены процедурно. Исследование показывает общий эффект, но не говорит, какая конкретная модель лучше подходит для вашего промпта. Кроме того, порог зависит от типа ограничений: у самой сильной модели успех на уровне отдельных заданий опускается ниже 50% уже при семи требованиях, а у 12 из 15 моделей — при трёх или меньшем числе.
Если ваши промпты регулярно содержат больше пяти-шести обязательных условий, вы сначала разбиваете их на этапы или всё ещё рассчитываете на один идеальный ответ? Источник: cs.AI updates on arXiv.org