Коротко
Исследователи предлагают разбирать влияние отдельных предложений промпта на конкретный ответ закрытой LLM через обучаемый суррогат. Подход обещает снизить зависимость от повторных обращений к API, но пока не отвечает на главный практический вопрос: насколько точно такой суррогат объясняет реальную модель.
Закрытую LLM нельзя напрямую исследовать: у пользователя есть только промпт, ответ и API. Работа на arXiv предлагает обходной путь — обучить отдельный интерпретатор, который после этого сможет оценивать вклад предложений промпта в выбранный результат без новых запросов к исходной модели.
Схема состоит из двух уровней. Сначала Energy-Based Model (EBM) выступает суррогатом и пытается воспроизвести концептуальную согласованность между запросами и ответами целевой LLM. Затем на основе этой «энергетической поверхности» обучается лёгкая сеть-интерпретатор.
На выходе получается не объяснение в духе «модель подумала вот так», а оценка влияния отдельных предложений промпта на конкретный целевой ответ. Это важное различие: метод анализирует наблюдаемое поведение модели, а не раскрывает её реальные внутренние вычисления.
Авторы делают ставку не только на локальный разбор одного запроса. Интерпретатор обучается на разнообразных входах, чтобы уловить более общие закономерности генерации и уменьшить зависимость объяснения от конкретного примера.
Практическая ценность здесь понятна: если суррогат достаточно хорошо имитирует целевую LLM, исследователь или разработчик сможет многократно анализировать промпты уже без постоянных обращений к дорогому или ограниченному API. Это особенно удобно для массового аудита и поиска предложений, которые сильнее всего влияют на заданный ответ.
Но именно качество суррогата становится критическим ограничением. Хорошее совпадение поведения EBM с целевой моделью ещё не гарантирует, что найденные связи являются причинными или сохраняются за пределами обучающих примеров. В представленном описании нет метрик, названий тестируемых LLM, датасетов и примеров ошибок, поэтому оценивать готовность подхода к реальному аудиту пока рано.
Главный результат работы — не «прозрачная закрытая модель», а более дешёвый слой поведенческого анализа поверх неё. Такой слой может быть полезен, но его объяснения нужно проверять так же строго, как и ответы самой LLM: интерпретатор тоже остаётся моделью, а не окном в настоящую внутреннюю логику.
Источник: cs.AI updates on arXiv.org