Чтение эмоций в токенском пространстве: дискриминирующая адаптация речи для эмоционального признания

#Чтение #Annualce #Type #Речи #Поскольку

arXiv: 2609.20081v1 Annualce Type: кросс-бюллетень: Речи показали большой потенциал для распознавания эмоций, но они прочли предсказанные эмоции от декодера в качестве процессора, не подходящего для классификации: он может излучать знаки вне набора целей и предпочитает частые классы. Мы предлагаем дискриминирующую адаптацию, в которой зачитывается скрытое состояние окончательного символа через классификационную головку и которая выпускает знак в одном переднем проходе без изменения позвоночника. Поскольку эта запись начинается с скрытого состояния, модель в противном случае декодируется, она дает контролируемое сопоставление генеративного и дискриминирующего вывода в иной идентичной речи LLM. Мы держим голову в одном линейном слое, делая мало точности для интерпретируемости: каждая эмоция становится одним направлением в выведенном символическом пространстве LLM, раскрывая сопутствующие символы. На IEMOCAP, в двух архитектурах LLM он улучшает Macro F1 и удаляет галлюцинации с наибольшим выигрышом по реалистичным стенограммам ASR. Наши аналии