Смена теста — это не справедливая фиксация: пределы представительства в моделях речи

#Смена #Аннонс #Whisper #HUBERT-major #Accent

arXiv: 2609.18533v1 Аннонс Тип: новое резюме: системы автоматического распознавания речи (АСР) имеют неравные показатели ошибок в различных группах, стимулируя вмешательство во внутренние представления. Мы задаемся вопросом о том, дают ли связанные с оратором атрибуты линейно учитываемые из предварительно подготовленных кодировок ASR полезные направления для сокращения пробелов в уровне слов-изменителя (WER). По всему среднему слою Whisper-, HUBERT-major и Wav2Vec2, больше по общему голосу и архиву речи Accent мы изучаем каждый слой энкодера на основе метаданных секс/гендерных данных, возраст и местные/адвентные знаки; конструкционный центроид и направление зондирования; ввод их в отдельные слои; и сравнение траекторий пробоотборников вниз по течению с соответствующими изменениями WER. Сексуальные этикетки весьма декодируемы (наилучшая макро-F1 0,924-0,941), местные/акцизные ярлыки также выше случайности (0,544-0696), а возраст слабее (0.354-0397). Из 22 перепроверок, проведенных после отбора, в 9 есть 95% интервалов между парами и загрузкой полностью ниже нуля, но каждый абсолютный источник-группа WER redu