• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Google DeepMind / Unsplash

У языковых моделей «зажигание» зависит от архитектуры, а не масштаба

Sh0ny
Sh0ny
7 августа 2026
  1. Главная
  2. Блог
  3. У языковых моделей «зажигание» зависит от архитектуры, а не масштаба
1 мин чтения

Коротко

Исследователи предложили метрику, которая измеряет, насколько резко языковая модель переходит от слабого сигнала к устойчивой обработке. Результат важнее самой метрики: архитектура и способ вычислений влияют на этот переход сильнее, чем ожидаемый рост масштаба.

У языковых моделей нашли не универсальный эффект масштаба, а архитектурную зависимость: одни модели демонстрируют резкий переход в обработке сигнала, другие наращивают результат почти линейно. Это может изменить то, как мы ищем «рабочее пространство» в нейросетях: смотреть придётся не только на размер модели, но и на то, как она считает.

Авторы вводят Ignition Index — показатель резкости перехода. Они подают на модель сигнал разной силы и отслеживают, как меняется точность линейного зонда по слоям. Затем подгоняют сигмоиду: высокий коэффициент крутизны означает почти скачкообразное «зажигание», низкий — постепенное накопление информации.

Важно не перепутать эту метрику с измерением сознания. Она проверяет конкретное динамическое свойство, связанное с Global Workspace Theory, на языковых представлениях. И всё же результат интересный: в исследовании 11 моделей пяти архитектурных семейств feedforward-трансформеры получили в среднем на 89% более высокий индекс, чем SSM-модели. У Mamba профили оказались почти линейными — без заметного глобального скачка.

У рекуррентной Huginn-3.5B обнаружился другой нюанс: «зажигание» было в 2,12 раза сильнее по оси итераций, чем по глубине модели. То есть для некоторых архитектур важнее не количество слоёв, а повторные проходы вычислений. А у Pythia-410M переход возник на шаге обучения 256, ещё до формирования induction heads. Возможно, важные механизмы появляются не одновременно и не в том порядке, который принято предполагать.

Ограничения у работы существенные. Связь индекса с масштабом модели и силой сигнала не подтвердилась, поэтому метрика пока не объясняет, почему возникает резкий переход и насколько он переносится на другие задачи. Исследование также не доказывает наличие у моделей сознания или полноценного глобального рабочего пространства — оно показывает измеримое поведение зондов в выбранном наборе моделей. Код эксперимента опубликован в репозитории Ignition Index.

Если выбирать между увеличением модели и изменением её вычислительной архитектуры, что, по-вашему, с большей вероятностью даст качественный скачок в рассуждениях? Источник: cs.AI updates on arXiv.org

новостиaillmнаука и техника
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​