Коротко
Исследование предлагает смотреть на выразительную силу трансформеров через теорию сложности схем, а не через маркетинговые обещания. Это помогает отделить возможности архитектуры от эффекта масштаба, точности вычислений и устройства внимания.
Трансформер может выглядеть мощным, но сама архитектура ещё не отвечает на вопрос, какие задачи он способен решать. Чтобы это выяснить, авторы предлагают сравнивать его не с абстрактным «интеллектом», а с формальными моделями вычислений.
Главный инструмент здесь — теория сложности схем. Она позволяет связать свойства трансформера с измеримыми ресурсами: глубиной и размером вычислений, типом операций, механизмом attention и точностью представления чисел.
Это важный сдвиг в постановке вопроса. Вместо «насколько умна модель» можно спрашивать: какие языки она распознаёт при заданном количестве слоёв, ограниченной точности и конкретной схеме внимания? Такой язык точнее описывает границы системы и позволяет сопоставлять разные архитектуры на общей теоретической основе.
Но ждать от этой работы таблицы с победителями не стоит. Перед нами обзор выбранных результатов, а не новый бенчмарк и не доказательство того, что трансформеры внезапно умеют решать больше практических задач. Абстракт также не приводит конкретных численных границ или новых прикладных возможностей; он скорее собирает теоретическую карту области.
Практический вывод простой: увеличение модели — не единственный фактор, который меняет её возможности. Глубина, точность вычислений и устройство attention могут быть не менее важны, а разговор о «способностях LLM» без указания этих ограничений часто оказывается слишком грубым.
Когда вы оцениваете новую LLM, что для вас важнее: её результат на тестах или понимание того, за счёт каких вычислительных ресурсов этот результат получен? Источник: cs.AI updates on arXiv.org