Реклама

Адаптация: адаптационная токеновая скругление для модели зрения-лангуажер через динамическое текстовое руководство

#Адаптация #Видеотипы #МОДС #Существующие #AdventionInfer

arXiv: 2508,06084v3 Видеотипы: заменить резюме: модели на языке зрения (МОДС) добились впечатляющих результатов в решении задач, связанных с мультимодальными закладками, однако расходы по-прежнему являются серьезной проблемой изза большого числа проекций зрения, обработанных на этапе предварительного заполнения. Существующие методы серфинга символов часто опираются на непосредственное использование статических схем внимания, не используя динамических внутренних сигналов в рамках ДУУ. Для решения этой проблемы мы предлагаем AdventionInfer, новую систему подсвечивания и игры для скручивания символов зрения. Во-первых, мы введем динамичный текстовый механизм серёжки, который создает мягкие приводы над текстовым значением на каждом срезном слое, что позволяет более осознанно показывать символы зрения на каждой стадии. Во-вторых, мы наблюдаем весьма последовательное распределение межрежимного внимания по архитектуре, что побуждает нас к внедрению эффективного графика с использованием данных, который автоматически определяет места серфинга. Экспериментальные результаты подтвердили эффективность

Компьютерная наука > Компютерное видение и распознавание шаблонов [представлено 8 августа 2025 года (v1), последний пересмотренный 4 октября 2026 года (эта версия, v3)] Название: AdaptInfer: Advenive Token Pruning for Vision-Language Model Forction через динамическое текстовое руководство Видение PDF HTML (экспериментальное) резюме: Vition-язычные модели (VLMs) достигли впечатляющих результатов в решении задач мультимодальных выводов, однако стоимость остается значительной проблемой изза большого числа проекций зрения, обработанных на этапе предварительного заполнения. Существующие методы серфинга символов часто опираются на непосредственное использование статических схем внимания, не используя динамических внутренних сигналов в рамках ДУУ. Для решения этой проблемы мы предлагаем AdventionInfer, новую систему подсвечивания и игры для скручивания символов зрения. Во-первых, мы введем динамичный текстовый механизм серёжки, который создает мягкие приводы над текстовым значением на каждом срезном слое, что позволяет более осознанно показывать символы зрения на каждой стадии. Во-вторых, мы наблюдаем весьма последовательное распределение межрежимного внимания по архитектуре, что побуждает нас к внедрению эффективного графика с использованием данных, который автоматически определяет места серфинга. Экспериментальные результаты подтвердили эффективность и обобщенность предлагаемого метода. При таком же символическом бюджете адаптация с точностью превышает существующие подходы.…