Реклама

V-CLA: Визуальное подавление с линейным вниманием

#V-CLA #Визуальное #Annualce #Type #Humber

arXiv:2610.11251v1 Annualce Type: New Humber: Vision-Language Models (VLM) продемонстрировали впечатляющие возможности, но страдают от значительных накладных вычислительных расходов, поскольку символы зрения доминируют в последовательности ввода данных. Это мотивирует символическое сжатие зрения в качестве ключевого направления для облегчения бремени. Однако с появлением гибридных архитектур, предусматривающих линейное внимание (eg, Qwen3.5), предыдущие методы, разработанные для борьбы за мягкую максимальную концентрацию внимания в целях обобщения. Проведенный нами анализ показывает, что подходы как с точки зрения внимания, так и на основе схожего подхода страдают от заметного ухудшения показателей деятельности, подчеркивая настоятельную необходимость применения методов сжатия, адаптированных к этому режиму. С этой целью мы предлагаем intextbf {V-ColA} — эффективную систему бестренировочного символического сжатия, специально предназначенную для линейного внимания. V-ColA вводит новый \текстит {уникальный критерий важности} для идентификации знаков критического зрения в сочетании с /текститом {адаптивная стратегия слияния}, который осуществляет компрессию. A