Реклама

:: Углубление программы CLS для получения изображений с высоким содержанием

#Углубление #Annuate #Type #Habstractive #Методы

arXiv:2610 10991v1 Annuate Type: New Habstractive: Методы поиска изображений часто полагаются на один глобальный семантический дескриптор, полученный из изображения, например символ [CLS] в трансформаторах зрения. Однако попытки связать всю семантическую информацию изображения в один дескриптор могут повредить работе поиска внизу, особенно для мелких задач поиска. В этой работе мы расширяем семантические символы в новых визуальных трансформаторах, глобальных [CLS] и четырех регистровых жетонах, используя тщательно выбранную подборку пространственных символов, цель которой состоит в том, чтобы запечатлеть представление пространственного региона, характеризующее содержимое каждого из сематических знаков. Мы используем модель DINOv2-reg, которая включает в себя регистрационные символы, которые появляются для изучения объекта и частичного представления. Для каждого символа "кувы" ([CLS] и для каждой регистрационной символы) мы находим символ "придурка", и извлекаем область N x N, чтобы создать набор локальных символов РОИ. Наш подход автомати

Компьютерные науки > Компютерное видение и распознавание шаблона [представлено 7 октября 2026 года] Название: Region-Aware CLS Token Aumentation for Fine-Grained Image Retrieval View PDF HTML (экспериментальное) Резюме: Методы поиска информации часто полагаются на единый глобальный семантический дескриптор, полученный из изображения, например символ [CLS] в трансформаторах зрения. Однако попытки связать всю семантическую информацию изображения в один дескриптор могут повредить работе поиска внизу, особенно для мелких задач поиска. В этой работе мы расширяем семантические символы в новых визуальных трансформаторах, глобальных [CLS] и четырех регистровых жетонах, используя тщательно выбранную подборку пространственных символов, цель которой состоит в том, чтобы запечатлеть представление пространственного региона, характеризующее содержимое каждого из сематических знаков. Мы используем модель DINOv2-reg, которая включает в себя регистрационные символы, которые появляются для изучения объекта и частичного представления. Для каждого символа "кувы" ([CLS] и для каждой регистрационной символы) мы находим символ "придурка", и извлекаем область N x N, чтобы создать набор локальных символов РОИ. Наш подход автоматически охватывает важные области, представляющие интерес, без каких-либо внешних территориальных ящиков или модулей суеспособности исключительно путем сопоставления семантичных символов со своими пространственными репрезентативными регионами. Кроме того, мы инкорпорируем эти…