ID-Align: " ROPE-Conshic Pointing for Dynamic High-Solution Approachation in Vision-Language Models &qt;

#ID-Align #ROPE-Conshic #Pointing #Dynamic #High-Solution

arXiv:2505.21465v2 Annuales Type: заменить перекрестное резюме: В настоящее время широко распространенный подход к повышению эффективности моделей зрения и языка (VLM) заключается в кодировании как варианта с высоким разрешением, так и большого пальца изображения одновременно. Хотя этот метод и эффективен, он создает большое количество символов изображения. В сочетании с широко используемыми позиционными узлами Ротари (ROPE) его долговременное разложение препятствует взаимодействию между символами высокого разрешения и жетонами большого пальца, а также между текстом и изображением. Для решения этих вопросов мы предлагаем ID-Argin, который смягчает эти проблемы путем изменения порядка идентификации позиций. При этом методе символы с высоким разрешением унаследуют удостоверения личности от их соответствующего жетона пальцем, сдерживая при этом чрезмерную экспансию индексов местоположения. Наши эксперименты, проведенные в рамках LLAVA-Next, показывают, что ID-Rign добивается значительных улучшений, включая увеличение на 6,09% задач MMBench в области рассуждений и заметные достижения во многих областях.