Скорректированное использование текста для мультимодального анализа сентимента
arXiv: 26009,06497v1 Аннонс Тип: перекрестное резюме: мультимодальный анализ настроений требует эффективного моделирования как словесной семантики, так и невербальных аффективных сигналов. Главная задача заключается в калибровке текстово-ориентированного понимания с помощью визуальных улик лица контролируемым, адаптивным и эффективным по параметру образом. Текст обычно служит семантическим якорем, в то время как визуальные сигналы служат дополнительным доказательством двусмысленных или имплицитных выражений; однако неизбирательное синтезирование может привести к визуальному шуму и искажению текстовых семантов. Кроме того, полная отработка крупных визуальных и текстовых кодировок сопряжена с большими расходами и может быть чрезмерно ориентирована на ограниченные и зависящие от сценариев контрольные показатели СУУ. Для решения этих вопросов мы предлагаем использовать в качестве контрольного визуального калибрования замороженных текстовых сообщений текстопостановку (VG-TPT), которая формулирует визуальные и текстовые модели. VG-TPT впрыскивает визуальные помехи в замороженный энкодер БЕРТ через адаптивные импульсы по слою, скорее тха