Alibaba
25 января 2026
Qwen3-Max-Thinking 2026-01-23
Контекст: —Вход: — / 1MВыход: — / 1M
Что нового
- Флагманская reasoning-модель Qwen с adaptive tool use, поиском и code interpreter
- Сопоставима с GPT-5.2 Thinking, Claude Opus 4.5 и Gemini 3 Pro на наборе из 19 бенчмарков
- Test-time scaling с итеративной рефлексией поднял GPQA с 90.3 до 92.8, HLE с 34.1 до 36.5 и LiveCodeBench v6 с 88.0 до 91.4
- HLE с инструментами вырос с 55.8 до 58.3, IMO-AnswerBench — с 89.5 до 91.5
Вердикт
Qwen3-Max-Thinking показала, что масштабирование inference — не только больше параллельных попыток: рефлексия над предыдущими траекториями дала заметный прирост при близком расходе токенов.