К модели визуализации и геофондирования: обследование

#Annuate #Type #Vision-Language #Foundation #VLFMS

arXiv:2406,09385v3 Annuate Type: заменить резюме: модели Vision-Language Foundation (VLFMS) добились значительного прогресса в решении различных задач мультимодального характера, таких как закладка изображений, поиск текстов снимков, визуальный ответ на вопросы и визуальное заземление. Однако большинство методов основаны на обучении общим наборам изображений, а отсутствие геопространственных данных приводит к низкой эффективности наблюдения Земли. В последнее время на них были предложены многочисленные наборы пар геопространственного изображения и текстовых наборов данных VLFM. Эти новые подходы направлены на использование крупномасштабных, мультимодальных геопространственных данных в целях создания многоплановых интеллектуальных моделей с различными географическими возможностями, которые мы называем моделями визуализации и геофонда (VLGFM). В настоящем документе содержится тщательный обзор ГЛГФМ, в котором резюмируются и анализируются последние события на местах. В частности, мы представляем историю и мотивацию в связи с повышением ОВГСФМ, подчеркивая их уникальное значение для научных исследований. Затем мы систематически резюмируем корку

Компьютерная наука > Компютерное видение и распознавание шаблонов [представлено 13 июня 2024 (v1), последний пересмотренный вариант 4 сентября 2026 года (эта версия, v3)] Название: Towards Vision-Language GeoFundation Model: A Survey View PDF HTML (экспериментальный) Резюме: Vition- Language Foundation модели (VLFMS) добились заметных успехов в решении различных задач мультимодального характера, таких как подсказка изображений, поиск снимков и текстов, визуальный ответ на вопросы и визуальная постановка. Однако большинство методов основаны на обучении общим наборам изображений, а отсутствие геопространственных данных приводит к низкой эффективности наблюдения Земли. В последнее время на них были предложены многочисленные наборы пар геопространственного изображения и текстовых наборов данных VLFM. Эти новые подходы направлены на использование крупномасштабных, мультимодальных геопространственных данных в целях создания многоплановых интеллектуальных моделей с различными географическими возможностями, которые мы называем моделями визуализации и геофонда (VLGFM). В настоящем документе содержится тщательный обзор ГЛГФМ, в котором резюмируются и анализируются последние события на местах. В частности, мы представляем историю и мотивацию в связи с повышением ОВГСФМ, подчеркивая их уникальное значение для научных исследований. Затем мы систематически резюмируем основные технологии, используемые в ВЛГФМ, включая создание данных, архитектуры моделей и применение различных смешанных…