Реклама

Учись на языке: переосмысление токенов в моделях языка зрения

#Учись #Annuate #Type #Ядро #Большого

arXiv: 2604.23950v2 Annuate Type: заменить резюме: модели зрения и языка (VLM) недавно продемонстрировали замечательные способности визуального понимания и аргументации, но они также создают значительное вычислительное бремя из-за длительных входных визуальных последовательностей. В ходе недавних работ этот вопрос решается за счет использования незначительных визуальных знаков, достижения существенного сокращения вычислительных мощностей при сохранении эффективности модели. Ядро символической резки заключается в определении символического значения, при этом нынешние подходы основываются главным образом на оценках внимания со стороны разработчиков зрения или моделей Большого языка (MLM). В настоящем документе мы анализируем эффективность механизмов внимания как в системах кодирования зрения, так и в ММ. Мы считаем, что кодеры зрения страдают от поглотителя внимания, в результате чего мало внимания уделяется информативным предыдущим регионам, а в МЛМ, хотя предыдущие исследования выявили смещение внимания к символическим позициям, внимание на текст-видение демонстрирует сопротивление этому перекосу и позволяет эффективно скручивать ги