Коротко
Reflection выпустила анонс модели, обученной с нуля в США, и обещает открытые веса под Apache 2.0. Для тех, кто выбирает модель для кода и агентов, главный вопрос не только в бенчмарках: можно ли будет проверить заявленные результаты самостоятельно?
Американским разработчикам достанется ещё одна крупная открытая модель, но анонс пока больше похож на заявление «мы из США и мы делаем всё сами», чем на заявку на лидерство. Reflection говорит, что Beam набрала 80,9 на SWE-bench Verified, но рядом с ведущими моделями это выглядит не так уж убедительно.
По архитектуре Beam это MoE: 501 млрд параметров суммарно, 23 млрд активных. Ориентирована на код, агентов и научные задачи. Компания обещает выложить полные веса под Apache 2.0 в этом же месяце.
Практическая ценность тут одна: если веса действительно появятся, можно будет запускать модель у себя и проверять на своих задачах, не привязываясь к чужому API. Для тех, кому важна открытая лицензия и происхождение, обученное с нуля в США, это расширяет варианты. Но само по себе происхождение ничего не говорит о том, потянет ли Beam конкретный проект.
Слабые места пока очевидны. В обзоре Beam ставят примерно на уровень GLM 5.2, а некоторые вообще считают её слабее DeepSeek V4 Flash по отдельным бенчмаркам. Reflection утверждает про высокую эффективность инференса, но ни независимой проверки, ни обещанного техотчёта пока нет. Так что цифры из анонса лучше воспринимать как повод обратить внимание, а не как доказательство, что модель лучше остальных.
А вы бы взяли модель с открытыми весами и проверяемым происхождением, если в ваших задачах она проигрывает лидерам бенчмарков?
Источник: Latent.Space