Коротко
CHORUS показывает, что в узкой инженерной задаче качество зависит не только от размера модели. Разбор объясняет, как объединение специализированных экспертов дало результат, который крупная DeepSeek-R1 не смогла превзойти.
В верификации чипов модель CHORUS размером 4B получила 88,0% Pass@1 на тесте CVDP-ECov — на 13,5 процентного пункта больше, чем DeepSeek-R1 с 671B. Но это не история о том, что маленькие модели внезапно стали сильнее больших вообще: выигрыш получен в конкретной задаче генерации стимулов для тестбенча.
Смысл задачи — писать исполняемый код, который помогает проверять аппаратную логику и находить больше вариантов поведения схемы. Здесь обратная связь от запуска теста полезнее, чем простое подражание примерам: код либо проходит проверку, либо нет.
CHORUS не пытается выжать всё из одного универсального эксперта. Сначала staged SFT создаёт несколько поведенчески разных чекпойнтов. Затем обучение с подкреплением и плотной наградой превращает их в сильных специалистов: общий результат у них похож, но сильные стороны на уровне отдельных задач различаются.
Дальше эти различия используют двумя способами — объединяют модели без дополнительного обучения или продолжают пост-тренинг. В итоге специалисты консолидируются в одну модель 4B. Практический вывод здесь важнее самого рекорда: при наличии хорошей исполняемой проверки иногда выгоднее собрать несколько узких компетенций, чем просто увеличивать число параметров.
Ограничение результата очевидно: цифра 88,0% относится к одному бенчмарку и одной области — генерации тестовых стимулов для аппаратной верификации. Из приведённого описания нельзя понять, насколько метод переносится на другие задачи, сколько стоило обучение и как он выглядит против других специализированных моделей. Поэтому сравнение с DeepSeek-R1 — сильный сигнал для этой задачи, но не общий рейтинг моделей.
Если бы вам нужно было автоматизировать инженерную задачу, вы бы сначала увеличивали модель или собирали несколько специализированных экспертов? Источник: cs.AI updates on arXiv.org