• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: National Cancer Institute / Unsplash

Верификация Verilog упёрлась не в модель, а в узкое окно отладки

Sh0ny
Sh0ny
5 августа 2026
  1. Главная
  2. Блог
  3. Верификация Verilog упёрлась не в модель, а в узкое окно отладки
1 мин чтения

Коротко

Исследователи связывают потолок около 95% у multi-agent систем для Verilog не только с качеством генерации, а с тем, какие данные агенту разрешают проверять. VeriTrace получил 100% Pass@1 на VerilogEval-V2, расширив пространство действий при отладке сигналов и временных интервалов.

Проблема автоматической генерации Verilog может быть не в том, что модель плохо пишет код. Она может просто слишком мало видеть, когда пытается понять, почему схема не работает.

Авторы VeriTrace связывают потолок современных multi-agent систем — около 95% на стандартных бенчмарках — с узким пространством действий при отладке. Агентам заранее ограничивают набор сигналов, временное окно для анализа или оба параметра сразу. В итоге проверка превращается в поиск знакомого паттерна на заранее подготовленном срезе поведения схемы.

VeriTrace предлагает другой подход. Его Inspector может независимо выбирать:

  • какие сигналы исследовать;
  • границы временного окна;
  • насколько глубоко продолжать итерации.

Это названо Agentic Temporal Exploration. Агент формулирует гипотезу о причине сбоя, запрашивает подтверждение по waveform, уточняет картину и повторяет цикл. То есть ключевое изменение находится не столько в базовой модели, сколько в том, какие действия ей разрешены во время отладки.

Результат, заявленный в работе, заметный: 100% Pass@1 на VerilogEval-V2 — первый такой результат для этого бенчмарка. При одинаковой базе Claude Sonnet 4.0 VeriTrace превзошёл сильнейший воспроизведённый baseline на 5,1%.

Но это не означает, что генерация RTL в целом стала решённой задачей. Показатель относится к конкретному бенчмарку, а сама работа демонстрирует более узкий и практически важный тезис: иногда последний процент качества получается не за счёт ещё одной, более мощной модели, а за счёт снятия искусственных ограничений с её инструментов.

Для агентных систем это хороший ориентир. Если агент стабильно ошибается на финальных шагах, стоит проверять не только промпт и модель, но и сам action space: какие наблюдения доступны, какие запросы разрешены и может ли агент возвращаться к гипотезе после получения новых данных.

Источник: cs.AI updates on arXiv.org

новостиaiагентыразработка
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​