Коротко
Подход C-VCE встраивает классификатор прямо в диффузионную модель через слой концептов, избавляясь от хрупкого внешнего классификатора. Разбираю, почему это меняет архитектуру доверия для vision-систем.
Контрфактические объяснения в компьютерном зрении отвечают на простой вопрос: какое минимальное изменение изображения перевернёт предсказание модели? В медицине, контроле качества и других safety-critical областях это не академическое упражнение — это способ понять, почему модель ошиблась или приняла рискованное решение.
Существующие подходы на базе диффузионных моделей умеют генерировать реалистичные правки, но упираются в архитектурный недостаток: им нужен внешний классификатор, который должен надёжно работать на зашумлённых промежуточных изображениях. По сути, чтобы объяснить одну модель, вы добавляете вторую — и должны доверять ей в условиях, где она заведомо нестабильна. Два чёрных ящика вместо одного.
C-VCE решает эту проблему иначе. Классификатор встраивается прямо в генеративную модель через concept bottleneck layer — слой, который оперирует человекочитаемыми признаками (концептами), а не пикселями. Контрфактические правки направляются этими концептами изнутри, без отдельной модели-надзирателя.
Пользователь может включать и выключать семантические концепты прямо во время сэмплинга. Модель минимально корректирует только релевантные регионы изображения, сохраняя остальное нетронутым и учитывая корреляции между признаками. Для контроля размера правок добавлен вероятностный регуляризатор, который балансирует между «переверни предсказание» и «останься близко к оригиналу», плюс градиентная маска, ограничивающая изменения наиболее значимыми областями.
На бенчмарке CelebA C-VCE сопоставим или превосходит базовые методы по flip rate (доле успешно перевёрнутых предсказаний), при этом контрфакты визуально ближе к исходному изображению и менее искажены. Это ожидаемо: когда классификатор не борется с шумом отдельно от генератора, правки получаются аккуратнее.
Главный вывод шире конкретного метода. Открытие и контроль внутреннего слоя концептов внутри генеративной модели — перспективный путь к тому, чтобы сделать диффузионные системы понятнее и безопаснее. Вместо того чтобы навешивать объяснимость снаружи через дополнительные модели, можно встроить её в архитектуру. Это меняет саму архитектуру доверия: вы доверяете одной модели с прозрачным слоем, а не стеку из двух непрозрачных.
Вопрос, который остаётся открытым: насколько концепт-бутылочное горлышко масштабируется на домены за пределами лиц и атрибутов вроде CelebA — скажем, на медицинские снимки, где концепты менее очевидны и их взаимосвязи сложнее.
Источник: cs.AI updates on arXiv.org