Коротко
Монолитная переписывание промпта может улучшить один навык и одновременно ухудшить другой. SAPO предлагает менять отдельные сегменты и показывает лучший средний результат на нескольких задачах, но пока только в ограниченной экспериментальной конфигурации.
Автоматическая оптимизация промптов часто переписывает инструкцию целиком — и именно поэтому может чинить одну проблему, создавая другую. SAPO предлагает более осторожную стратегию: разбирать промпт на части и улучшать только те сегменты, где видна слабость.
Промпт делится на четыре компонента: роль, контекст, задачи и формат ответа. Затем метод сравнивает лучшие и худшие примеры — по пять каждого типа — и пытается понять, какая именно часть инструкции тянет результат вниз.
Дальше один LLM выполняет два шага: сначала диагностирует сегменты и формулирует рекомендации, затем генерирует новые варианты с учётом сильных и слабых сигналов. Это важное отличие от подхода «перепиши всё заново»: удачные части промпта становятся ограничениями, а не случайно уничтожаются очередной редакцией.
В экспериментах на SQuADv2, TweetEval, XSUM, CommonGen и GSM8K, с GPT-3.5-Turbo и GPT-4o-mini, SAPO показал лучший средний результат по сравнению с Zero-shot и несколькими методами автоматической оптимизации, включая APE, OPRO, EvoPrompt, GEPA и StraGO. Для практики отсюда следует простой вывод: если промпт уже работает, выгоднее искать слабый участок, чем просить модель переписать инструкцию целиком.
Но масштабировать этот вывод пока рано. В описании нет деталей о величине улучшений, стоимости итераций и том, насколько метод переносится на другие модели и задачи. Результаты получены в конкретной экспериментальной схеме с двумя моделями, а «лучший средний результат» не означает победу на каждом отдельном наборе данных.
Когда ваш промпт начинает деградировать после очередной оптимизации, вы обычно переписываете его целиком или сначала ищете проблемный сегмент? Источник: cs.AI updates on arXiv.org