• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Andrea De Santis / Unsplash

52 VLM проверили на редких спутниковых снимках — результат средний

Sh0ny
Sh0ny
30 июля 2026
  1. Главная
  2. Блог
  3. 52 VLM проверили на редких спутниковых снимках — результат средний
1 мин чтения

Коротко

Новый бенчмарк RRS-10K с военными сценами показал: vision-language модели, уверенно работающие на обычных снимках, теряются на редких. Разбор, где именно они ломаются и почему это важно за пределами спутниковой съёмки.

Vision-language модели (VLM) давно показывают хорошие результаты на стандартных задачах дистанционного зондирования — распознавание городских кварталов, сельхозугодий, дорог. Но бенчмарк RRS-10K проверил 52 модели на редких сценах, и картина оказалась куда менее радужной: zero-shot производительность — умеренная, а в ряде задач модели откровенно проваливаются.

Проблема существующих бенчмарков — доминирование типовых городских и сельских сцен. RRS-10K закрывает этот пробел: 10 738 спутниковых снимков военной тематики, собранных из первоисточников, с QA-парами в нескольких форматах. Структура — три измерения (перцепция, рассуждение, робастность), шесть подизмерений, 20 листовых задач.

Где именно модели ломаются: visual grounding, referring segmentation и сложное семантическое рассуждение. Это не косметические недочёты — это базовые способности, без которых VLM бесполезна в реальном анализе нетипичных сцен. Если модель не может локализовать объект на редком снимке, её «рассуждение» поверх этого снимка не стоит ничего.

Авторы также предложили стратегию SDFS (similarity-based distractor filtering) для отсева слишком похожих вариантов в multiple-choice вопросах. Это снижает шанс, что модель угадывает ответ по структуре вопроса, а не по содержанию изображения — частая проблема бенчмарков с QA-форматом.

Для разработчиков, использующих VLM за пределами космической съёмки, вывод прямой: хорошие метрики на популярных датасетах не гарантируют работу на длинном хвосте распределения. RRS-10K даёт систематическую карту отказов — и это полезнее очередного рекорда на leaderboard.

Источник: cs.AI updates on arXiv.org

новостиaillmнейросети
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​