Коротко
Сравнение Nano Banana 2 и 2.1 проверяет лишь три задачи и опирается на единичные генерации. Разбираемся, почему такой тест помогает заметить возможные различия, но не подтверждает общее превосходство новой версии.
Обещание улучшить качество, текст на изображениях и стабильность персонажей звучит широко. Но сравнение Nano Banana 2 и 2.1 на трёх промптах не позволяет выяснить, какая версия лучше в целом.
Автор прогнал одинаковые запросы через обе модели и оценил результат по чек-листу. Полезный способ увидеть возможные различия на конкретных задачах, но в доступном тексте нет самих результатов, так что проверить вывод о том, где выиграла новая версия, нельзя.
Ограничения здесь существенные: по одному запуску на модель, всего три задачи, один оценщик. Такой тест не измеряет стабильность результата и не заменяет независимый бенчмарк. По словам автора, на указанную в статье дату независимых замеров не было, а публикации о релизе ссылались на таблицу Google.
Когда выбираешь модель для своих задач, важнее заявленные тесты разработчика или собственные прогоны на привычных запросах?
Источник: Все статьи подряд / Искусственный интеллект / Хабр