Декодер-Агнотическое объединение для трансформаторов зрения: систематическое исследование G2TM

#Декодер-Агнотическое #Видеотип #Vision #Transformers #ViTs

arXiv:2609.18279v1 Видеотип: новое резюме: Vision Transformers (ViTs) достигли самых современных результатов в работе по выполнению целого ряда задач компьютерного видения, главным образом благодаря механизму самовнимания. Однако ее сложность, увеличивающаяся в четырехкратном выражении с учетом количества знаков, остается главным препятствием на пути повышения эффективности и развертывания ВИТ в масштабах. Токен-слияние сокращает эти расходы за счет суммирования избыточных символов. Тем не менее существующие методы обычно оцениваются в рамках единой архитектуры, оставляя открытым вопрос об их эффективности независимо от того, является ли они результатом самого механизма слияния или же конкретного декодера, с которым они сочетаются. Мы продлеваем Graph-Guided Token Merging (G2TM) — один модуль, введенный на ранней стадии сети VIT, помимо его оригинальной настройки сегментеров. Мы оцениваем G2TM по трем семантическим системам сегментации (сегментер, SETR, EOMT) и трем семьям декодеров (линейные, трансформаторно-коммунальные), а также стандартную классификацию изображений VIT. Наши результаты показывают, что G2TM - это побоя.