Коротко
Argon сравнялся с GPT-6 Astra в одной независимой оценке, а Google заявляет о лидерстве на 13 из 19 тестов. Но длинный вывод обходится дорого по расходу токенов, а доступ пока ограничен.
Миллион токенов вывода, и для тех, кто даёт модели долгие задачи, это выглядит как подарок. Но у Gemini 4 Argon есть подвох: в одной из оценок он тратил на задачу более чем вдвое больше выходных токенов, чем GPT-6 Astra.
Google заявляет, что Argon занял первое место на 13 из 19 тестов. В независимой оценке Artificial Analysis он набрал 53 балла, столько же, сколько Astra. Миллион токенов достигается через Long Decode Continuation: длинный ответ приостанавливается, а затем продолжается следующими вызовами API.
По данным Artificial Analysis, при вводной скидке задача на Argon обходилась в $1,99 против $3,26 у Astra. Однако Argon использовал в среднем 62 тысячи выходных токенов на задачу, Astra около 27 тысяч. Экономия получалась за счёт цены токенов, а не их бережного расхода. Без скидки стоимость задачи Argon в этой оценке выросла бы до $3,98.
Пока Argon доступен только участникам правительственной программы Fairwind и проверенным специалистам по кибербезопасности. Google обещает расширить доступ после доработки защитных ограничений. Есть и вопросы к самим результатам: часть наблюдателей сомневается в отдельных цифрах, а на одном юридическом тесте Argon уступил Muse Spark 1.2. Поэтому рекорд по длине ответа пока проще подтвердить, чем убедиться в его надёжности для повседневной работы.
В какой задаче длинный ответ модели сэкономил бы вам время, даже если она расходует больше токенов? Источник: Latent.Space