Коротко
Исследователи предложили HOBA — иерархический фреймворк, где LLM задаёт гиперпараметры, а RL-агент выбирает экспертов для ставок в реальном времени. Подход снижает риски эксплорации и даёт прирост целевой метрики на 3.6% в проде.
Онлайн-реклама обычно держится на стопке оффлайн-обученных моделей: PID-контроллеры, MPC, offline RL. Проблема в том, что аукционный рынок нестационарен, а ручная настройка границ ставок и бюджетов стоит дорого и не успевает за реальностью. HOBA решает это через иерархический reinforcement learning, разделяя стратегию, выбор модели и исполнение ставки на три временных масштаба.
На верхнем уровне работает большая языковая модель. Она выводит гиперпараметры из контекстных сигналов через цикл Think-Act-Observe-Reflect с извлечением исторического опыта. По сути, LLM здесь выступает не как генератор текста, а как стратегический рассуждатель, который адаптирует систему к меняющимся условиям рынка.
На среднем уровне агент SARSA динамически выбирает между экспертами из пула, включающего PID, MPC, IQL и Decision Transformer. Чтобы убрать смещение выбора, применяется причинная корректировка (causal adjustment). На нижнем уровне эксперты исполняют ставки в рамках ограничений, заданных сверху.
Главная инженерная находка — онлайн-обучение ограничено дискретным выбором эксперта, а не непрерывной оптимизацией ставки. Это радикально снижает риск эксплорации в проде, сохраняя при этом адаптивность. Вместо того чтобы агент учился тыкать ставки наугад и терять деньги, он учится выбирать подходящую готовую модель под текущий контекст.
На бенчмарке AuctionNet и в масштабном A/B-тесте HOBA показала стабильное улучшение над state-of-the-art бейзлайнами. В реальном онлайн-внедрении фреймворк принес +3.6% к целевой стоимости, что подтверждает жизнеспособность иерархического мультиагентного подхода.
Источник: cs.AI updates on arXiv.org