Отбор комприляционных/руководящих энкодеров для многоканальных крупных аудио-ланговых моделей

#Отбор #Annuate #Type #Brieft #Multi-encoder

arXiv: 2609.18041v1 Annuate Type: cross Brieft: Multi-encoder Instruction from Major-Audio Language Models (LALMS) расширяет распознавание речи, но при отборе кодировщиков с помощью интуиции или исчерпывающего поиска часто возникает избыточное представление и накачивается уже ограниченный бюджет вычисления. Мы предлагаем CUES (корреляция - отбор компримированного энкодера), легкую эвристику, которая оценивает взаимодополняемость на основе сопоставления задач и категорий Pearson между профилями работы кодеров, выбирая кандидата из одних только оценок без обучения по синтезу во время отбора. Оценивая базовый показатель XARES-LMM с использованием замороженного позвоночника SmolLM2-135М (лоРА, адаптированного) посредством пятикратной перекрестной проверки, CUES последовательно определяет одну и ту же конфигурацию на трек из одного лишь задерживаемого участка разработки без использования данных испытаний для отбора. В широком номере Дорожки~А CUES выбирает межсемейный трио (Whisper-средний, mHuBERT-147 и Dasheng-база), достигая 4,3