• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Thorium / Unsplash

Трансформеры оценивают не по «уму», а по вычислительным ресурсам

Sh0ny
Sh0ny
15 августа 2026
  1. Главная
  2. Блог
  3. Трансформеры оценивают не по «уму», а по вычислительным ресурсам
1 мин чтения

Коротко

Исследование предлагает смотреть на выразительную силу трансформеров через теорию сложности схем, а не через маркетинговые обещания. Это помогает отделить возможности архитектуры от эффекта масштаба, точности вычислений и устройства внимания.

Трансформер может выглядеть мощным, но сама архитектура ещё не отвечает на вопрос, какие задачи он способен решать. Чтобы это выяснить, авторы предлагают сравнивать его не с абстрактным «интеллектом», а с формальными моделями вычислений.

Главный инструмент здесь — теория сложности схем. Она позволяет связать свойства трансформера с измеримыми ресурсами: глубиной и размером вычислений, типом операций, механизмом attention и точностью представления чисел.

Это важный сдвиг в постановке вопроса. Вместо «насколько умна модель» можно спрашивать: какие языки она распознаёт при заданном количестве слоёв, ограниченной точности и конкретной схеме внимания? Такой язык точнее описывает границы системы и позволяет сопоставлять разные архитектуры на общей теоретической основе.

Но ждать от этой работы таблицы с победителями не стоит. Перед нами обзор выбранных результатов, а не новый бенчмарк и не доказательство того, что трансформеры внезапно умеют решать больше практических задач. Абстракт также не приводит конкретных численных границ или новых прикладных возможностей; он скорее собирает теоретическую карту области.

Практический вывод простой: увеличение модели — не единственный фактор, который меняет её возможности. Глубина, точность вычислений и устройство attention могут быть не менее важны, а разговор о «способностях LLM» без указания этих ограничений часто оказывается слишком грубым.

Когда вы оцениваете новую LLM, что для вас важнее: её результат на тестах или понимание того, за счёт каких вычислительных ресурсов этот результат получен? Источник: cs.AI updates on arXiv.org

новостиaillmнаука и техника
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​