• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Ady TeenagerInRO / Unsplash

Как модель 4B обошла 671B на тесте верификации чипов

Sh0ny
Sh0ny
12 августа 2026
  1. Главная
  2. Блог
  3. Как модель 4B обошла 671B на тесте верификации чипов
1 мин чтения

Коротко

CHORUS показывает, что в узкой инженерной задаче качество зависит не только от размера модели. Разбор объясняет, как объединение специализированных экспертов дало результат, который крупная DeepSeek-R1 не смогла превзойти.

В верификации чипов модель CHORUS размером 4B получила 88,0% Pass@1 на тесте CVDP-ECov — на 13,5 процентного пункта больше, чем DeepSeek-R1 с 671B. Но это не история о том, что маленькие модели внезапно стали сильнее больших вообще: выигрыш получен в конкретной задаче генерации стимулов для тестбенча.

Смысл задачи — писать исполняемый код, который помогает проверять аппаратную логику и находить больше вариантов поведения схемы. Здесь обратная связь от запуска теста полезнее, чем простое подражание примерам: код либо проходит проверку, либо нет.

CHORUS не пытается выжать всё из одного универсального эксперта. Сначала staged SFT создаёт несколько поведенчески разных чекпойнтов. Затем обучение с подкреплением и плотной наградой превращает их в сильных специалистов: общий результат у них похож, но сильные стороны на уровне отдельных задач различаются.

Дальше эти различия используют двумя способами — объединяют модели без дополнительного обучения или продолжают пост-тренинг. В итоге специалисты консолидируются в одну модель 4B. Практический вывод здесь важнее самого рекорда: при наличии хорошей исполняемой проверки иногда выгоднее собрать несколько узких компетенций, чем просто увеличивать число параметров.

Ограничение результата очевидно: цифра 88,0% относится к одному бенчмарку и одной области — генерации тестовых стимулов для аппаратной верификации. Из приведённого описания нельзя понять, насколько метод переносится на другие задачи, сколько стоило обучение и как он выглядит против других специализированных моделей. Поэтому сравнение с DeepSeek-R1 — сильный сигнал для этой задачи, но не общий рейтинг моделей.

Если бы вам нужно было автоматизировать инженерную задачу, вы бы сначала увеличивали модель или собирали несколько специализированных экспертов? Источник: cs.AI updates on arXiv.org

новостиaillmразработка
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​