Коротко
Исследователи связывают потолок около 95% у multi-agent систем для Verilog не только с качеством генерации, а с тем, какие данные агенту разрешают проверять. VeriTrace получил 100% Pass@1 на VerilogEval-V2, расширив пространство действий при отладке сигналов и временных интервалов.
Проблема автоматической генерации Verilog может быть не в том, что модель плохо пишет код. Она может просто слишком мало видеть, когда пытается понять, почему схема не работает.
Авторы VeriTrace связывают потолок современных multi-agent систем — около 95% на стандартных бенчмарках — с узким пространством действий при отладке. Агентам заранее ограничивают набор сигналов, временное окно для анализа или оба параметра сразу. В итоге проверка превращается в поиск знакомого паттерна на заранее подготовленном срезе поведения схемы.
VeriTrace предлагает другой подход. Его Inspector может независимо выбирать:
Это названо Agentic Temporal Exploration. Агент формулирует гипотезу о причине сбоя, запрашивает подтверждение по waveform, уточняет картину и повторяет цикл. То есть ключевое изменение находится не столько в базовой модели, сколько в том, какие действия ей разрешены во время отладки.
Результат, заявленный в работе, заметный: 100% Pass@1 на VerilogEval-V2 — первый такой результат для этого бенчмарка. При одинаковой базе Claude Sonnet 4.0 VeriTrace превзошёл сильнейший воспроизведённый baseline на 5,1%.
Но это не означает, что генерация RTL в целом стала решённой задачей. Показатель относится к конкретному бенчмарку, а сама работа демонстрирует более узкий и практически важный тезис: иногда последний процент качества получается не за счёт ещё одной, более мощной модели, а за счёт снятия искусственных ограничений с её инструментов.
Для агентных систем это хороший ориентир. Если агент стабильно ошибается на финальных шагах, стоит проверять не только промпт и модель, но и сам action space: какие наблюдения доступны, какие запросы разрешены и может ли агент возвращаться к гипотезе после получения новых данных.
Источник: cs.AI updates on arXiv.org