• Home
  • News
  • Blog
  • Releases
  • LLM history
  • Compare LLMs
  • Library
  • About
⌘K
Sign in
Alibaba

25 января 2026

Qwen3-Max-Thinking 2026-01-23

Context: —Input: — / 1MOutput: — / 1M

What's new
  • Флагманская reasoning-модель Qwen с adaptive tool use, поиском и code interpreter
  • Сопоставима с GPT-5.2 Thinking, Claude Opus 4.5 и Gemini 3 Pro на наборе из 19 бенчмарков
  • Test-time scaling с итеративной рефлексией поднял GPQA с 90.3 до 92.8, HLE с 34.1 до 36.5 и LiveCodeBench v6 с 88.0 до 91.4
  • HLE с инструментами вырос с 55.8 до 58.3, IMO-AnswerBench — с 89.5 до 91.5
Verdict

Qwen3-Max-Thinking показала, что масштабирование inference — не только больше параллельных попыток: рефлексия над предыдущими траекториями дала заметный прирост при близком расходе токенов.

Qwen Team

A blog and notes on development. The easiest way to reach me is via the social links below.

Contacts
talalaev.misha@gmail.com
Documents
Personal data processing policyPersonal data processing consent