Коротко
Исследователи предложили метрику, которая измеряет, насколько резко языковая модель переходит от слабого сигнала к устойчивой обработке. Результат важнее самой метрики: архитектура и способ вычислений влияют на этот переход сильнее, чем ожидаемый рост масштаба.
У языковых моделей нашли не универсальный эффект масштаба, а архитектурную зависимость: одни модели демонстрируют резкий переход в обработке сигнала, другие наращивают результат почти линейно. Это может изменить то, как мы ищем «рабочее пространство» в нейросетях: смотреть придётся не только на размер модели, но и на то, как она считает.
Авторы вводят Ignition Index — показатель резкости перехода. Они подают на модель сигнал разной силы и отслеживают, как меняется точность линейного зонда по слоям. Затем подгоняют сигмоиду: высокий коэффициент крутизны означает почти скачкообразное «зажигание», низкий — постепенное накопление информации.
Важно не перепутать эту метрику с измерением сознания. Она проверяет конкретное динамическое свойство, связанное с Global Workspace Theory, на языковых представлениях. И всё же результат интересный: в исследовании 11 моделей пяти архитектурных семейств feedforward-трансформеры получили в среднем на 89% более высокий индекс, чем SSM-модели. У Mamba профили оказались почти линейными — без заметного глобального скачка.
У рекуррентной Huginn-3.5B обнаружился другой нюанс: «зажигание» было в 2,12 раза сильнее по оси итераций, чем по глубине модели. То есть для некоторых архитектур важнее не количество слоёв, а повторные проходы вычислений. А у Pythia-410M переход возник на шаге обучения 256, ещё до формирования induction heads. Возможно, важные механизмы появляются не одновременно и не в том порядке, который принято предполагать.
Ограничения у работы существенные. Связь индекса с масштабом модели и силой сигнала не подтвердилась, поэтому метрика пока не объясняет, почему возникает резкий переход и насколько он переносится на другие задачи. Исследование также не доказывает наличие у моделей сознания или полноценного глобального рабочего пространства — оно показывает измеримое поведение зондов в выбранном наборе моделей. Код эксперимента опубликован в репозитории Ignition Index.
Если выбирать между увеличением модели и изменением её вычислительной архитектуры, что, по-вашему, с большей вероятностью даст качественный скачок в рассуждениях? Источник: cs.AI updates on arXiv.org