Коротко
Исследователи предлагают обучать не только веса модели, но и процедуры, которые помогают ей решать задачи. Самое интересное — после постепенного удаления этих процедур модель сохраняет большую часть прироста.
Главная ставка этой работы — научить LLM не просто пользоваться внешней процедурой, а постепенно встраивать её навык в собственные параметры. На FeatureBench такой подход дал прирост в 8,1 процентного пункта, а после отключения внешнего scaffold модель сохранила 85,2% результата, полученного с ним.
Обычно эти две части живут отдельно: модель дообучают на данных, а цепочки действий, инструменты и другие процедурные подсказки проектируют уже для этапа инференса. Авторы предлагают связать их в эволюционирующий граф: находить полезные навыки, дистиллировать их в модель и динамически пересобирать процедуры по мере обучения.
Практический смысл здесь важнее красивого слова «эволюция». Внешний scaffold может временно выступать как костыль или тренер: он помогает модели пройти больше задач, после чего часть стратегии переносится внутрь. В результате на том же наборе данных подход заметно обошёл стандартный SFT, а модель продолжила решать задачи даже без внешней поддержки.
Но это пока не доказательство универсального способа обучать агентов. В источнике показан результат на одном бенчмарке, а в абстракте нет деталей о самой архитектуре графа, стоимости обучения и том, какие именно навыки были обнаружены. Поэтому 8,1 процентного пункта — аргумент в пользу направления, а не гарантия, что любой набор инструментов удастся так же успешно «запечь» в веса модели.
Если внешний scaffold даёт сильный прирост, но потом его можно убрать, где для вас проходит граница между полезным обучающим костылём и зависимостью модели от процедур? Источник: cs.CL updates on arXiv.org