Коротко
SKILL показывает, что для оптимизации логических схем языковой модели недостаточно: ей нужны специализированные роли, взаимодействие с инструментами и механизм самокоррекции. Разбираем, откуда берётся заявленный прирост и почему его пока нельзя считать универсальным.
В оптимизации логических схем главный результат SKILL даёт не «умный промпт», а связка из нескольких механизмов. На тестах система показала улучшение PDA-метрик на 12,4% относительно экспертных потоков и успешно справилась с 86,3% задач на системах размером до 500 тысяч вентилей.
Практический смысл здесь в разделении работы между агентами. GPT-4o отвечает за стратегическое планирование, Claude Sonnet 4 — за детальное рассуждение, Gemini 2.5 Pro — за эффективный анализ. Отдельный RL-агент взаимодействует с инструментами синтеза и учится выбирать действия, а не только выдавать текстовый совет.
Самая интересная часть — self-correcting module. Он смотрит на обратную связь среды и PDA-метрики, замечает неудачное поведение и запускает восстановление с помощью LLM. Иными словами, модель не обязана с первого раза угадать удачную последовательность оптимизаций: система может распознать плохой шаг и попробовать другой сценарий.
Это важный сдвиг в применении LLM к инженерным задачам. Модель здесь не заменяет оптимизатор и не получает полный контроль над процессом. Она становится верхним уровнем управления, который предлагает стратегии, тогда как RL и инструменты синтеза проверяют их последствия.
Но ограничения существенные. Авторы проверяли SKILL на наборах IWLS, OpenCores и EPFL, а заявленный результат относится к логическим системам до 500 тысяч вентилей. В самой постановке остаются экспоненциально растущее пространство поиска и разреженные награды; кроме того, для RL отмечены низкая эффективность обучения и ограниченная интерпретируемость. Поэтому это сильный результат на выбранных бенчмарках, но не доказательство того, что такая архитектура одинаково хорошо работает на любых схемах и в реальном промышленном потоке.
Главный урок для прикладных агентов простой: самокоррекция полезна только тогда, когда у системы есть измеримая обратная связь от настоящего инструмента. Если агент лишь перечитывает собственный ответ, это не исправление, а ещё один круг генерации. Где вы бы доверили такой связке принимать решения: в исследовательском бенчмарке или уже в производственном синтезе?
Источник: cs.AI updates on arXiv.org