Коротко
Новый бенчмарк RRS-10K с военными сценами показал: vision-language модели, уверенно работающие на обычных снимках, теряются на редких. Разбор, где именно они ломаются и почему это важно за пределами спутниковой съёмки.
Vision-language модели (VLM) давно показывают хорошие результаты на стандартных задачах дистанционного зондирования — распознавание городских кварталов, сельхозугодий, дорог. Но бенчмарк RRS-10K проверил 52 модели на редких сценах, и картина оказалась куда менее радужной: zero-shot производительность — умеренная, а в ряде задач модели откровенно проваливаются.
Проблема существующих бенчмарков — доминирование типовых городских и сельских сцен. RRS-10K закрывает этот пробел: 10 738 спутниковых снимков военной тематики, собранных из первоисточников, с QA-парами в нескольких форматах. Структура — три измерения (перцепция, рассуждение, робастность), шесть подизмерений, 20 листовых задач.
Где именно модели ломаются: visual grounding, referring segmentation и сложное семантическое рассуждение. Это не косметические недочёты — это базовые способности, без которых VLM бесполезна в реальном анализе нетипичных сцен. Если модель не может локализовать объект на редком снимке, её «рассуждение» поверх этого снимка не стоит ничего.
Авторы также предложили стратегию SDFS (similarity-based distractor filtering) для отсева слишком похожих вариантов в multiple-choice вопросах. Это снижает шанс, что модель угадывает ответ по структуре вопроса, а не по содержанию изображения — частая проблема бенчмарков с QA-форматом.
Для разработчиков, использующих VLM за пределами космической съёмки, вывод прямой: хорошие метрики на популярных датасетах не гарантируют работу на длинном хвосте распределения. RRS-10K даёт систематическую карту отказов — и это полезнее очередного рекорда на leaderboard.
Источник: cs.AI updates on arXiv.org