• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Jo Lin / Unsplash

LLM как режиссёр торгов: архитектура HOBA для онлайн-рекламы

Sh0ny
Sh0ny
30 июля 2026
  1. Главная
  2. Блог
  3. LLM как режиссёр торгов: архитектура HOBA для онлайн-рекламы
1 мин чтения

Коротко

Исследователи предложили HOBA — иерархический фреймворк, где LLM задаёт гиперпараметры, а RL-агент выбирает экспертов для ставок в реальном времени. Подход снижает риски эксплорации и даёт прирост целевой метрики на 3.6% в проде.

Онлайн-реклама обычно держится на стопке оффлайн-обученных моделей: PID-контроллеры, MPC, offline RL. Проблема в том, что аукционный рынок нестационарен, а ручная настройка границ ставок и бюджетов стоит дорого и не успевает за реальностью. HOBA решает это через иерархический reinforcement learning, разделяя стратегию, выбор модели и исполнение ставки на три временных масштаба.

На верхнем уровне работает большая языковая модель. Она выводит гиперпараметры из контекстных сигналов через цикл Think-Act-Observe-Reflect с извлечением исторического опыта. По сути, LLM здесь выступает не как генератор текста, а как стратегический рассуждатель, который адаптирует систему к меняющимся условиям рынка.

На среднем уровне агент SARSA динамически выбирает между экспертами из пула, включающего PID, MPC, IQL и Decision Transformer. Чтобы убрать смещение выбора, применяется причинная корректировка (causal adjustment). На нижнем уровне эксперты исполняют ставки в рамках ограничений, заданных сверху.

Главная инженерная находка — онлайн-обучение ограничено дискретным выбором эксперта, а не непрерывной оптимизацией ставки. Это радикально снижает риск эксплорации в проде, сохраняя при этом адаптивность. Вместо того чтобы агент учился тыкать ставки наугад и терять деньги, он учится выбирать подходящую готовую модель под текущий контекст.

На бенчмарке AuctionNet и в масштабном A/B-тесте HOBA показала стабильное улучшение над state-of-the-art бейзлайнами. В реальном онлайн-внедрении фреймворк принес +3.6% к целевой стоимости, что подтверждает жизнеспособность иерархического мультиагентного подхода.

Источник: cs.AI updates on arXiv.org

новостиaillmагенты
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​