• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Taras Moskalchuk / Unsplash

LLM можно обновлять одним адаптером — но сначала найдите домен

Sh0ny
Sh0ny
8 августа 2026
  1. Главная
  2. Блог
  3. LLM можно обновлять одним адаптером — но сначала найдите домен
1 мин чтения

Коротко

SemiAdapt-Instruct предлагает заменять полное переобучение точечным обновлением одного LoRA-адаптера. Это делает модель расширяемой, но переносит сложность на поиск границ между доменами и маршрутизацию запросов.

Главное обещание SemiAdapt-Instruct — не улучшить модель ещё на несколько процентов, а сделать её обновляемой по частям. Если в системе появляется новый домен, авторы предлагают обучать только один новый LoRA-адаптер, не трогая уже настроенные компоненты.

Схема выглядит так: система сама выделяет скрытые домены в инструкционных данных, для каждого домена параллельно обучаются адаптеры, а затем запрос направляется к нужному компоненту без дополнительных обучаемых параметров. В отличие от монолитного fine-tuning, новая область знаний не требует заново менять всю модель.

Это полезный сдвиг в архитектуре. Модель можно воспринимать не как один неподвижный файл, а как базу с набором сменных специализаций: один адаптер отвечает за конкретную область, другой добавляется позже. По данным авторов, подход превзошёл полное дообучение по ROUGE-L и оценке LLM-as-a-judge во всех проверенных конфигурациях, при этом сопоставим с обычным обучением одного LoRA-адаптера.

Самый интересный результат — при добавлении данных нового домена обновление одного адаптера оказалось лучше всех монолитных базовых подходов. Кроме того, разные методы выделения доменов независимо сходились к похожим специализациям. Это намекает, что разбиение инструкций на домены может быть не только удобной инженерной эвристикой.

Но есть важная оговорка. В доступном описании нет конкретных метрик, датасетов, числа доменов и стоимости маршрутизации. И «parameter-free routing» не означает отсутствия сложности: сначала нужно корректно обнаружить домены, подготовить данные и понять, куда направлять неоднозначный запрос. Если разбиение получилось плохим, модульность может превратиться в набор конфликтующих адаптеров.

Практический вывод пока осторожный: для меняющихся систем идея выглядит сильнее, чем очередное обещание «дообучить модель дешевле». Но перед внедрением нужно проверить не только качество каждого адаптера, а и стабильность маршрутизации при появлении новых областей. Если ваши данные постоянно меняются, что было бы болезненнее: заново переобучать всю модель или поддерживать карту доменов и адаптеров?

Источник: cs.CL updates on arXiv.org

новостиaillmразработка
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​