G-Mamba: Sparse Hraph-Guided Mamba for Audio-Visual Ranguage
arXiv:2609.18009v1 Тип уведомления: перекрестное резюме: модели легкой аудиовизуальной речи (AVSE) сталкиваются с критическим компромиссом между вычислительной эффективностью и точностью межрезонансной синхронизации. Хотя простая конкателяция не имеет релятивной экспрессии, плотное перекрестное внимание вызывает вычислительные накладные расходы и подвержено риску ненадежной переписки между различными видами транспорта под сильным акустическим воздействием. Мы предлагаем Sparse Graph-Guided Mamba (SG-Mamba) — легкую систему AVSE, которая объединяет незначительный разнородный график с линейно-сложным позвоночником MambA. На графике четко моделируются отношения с конкретными видами деятельности посредством ориентации на содержание и перекрестных аудио-визуальных связей, в то время как Mamba отражает дальний временной контекст. Мы далее введем аудио-пропусковое соединение, чтобы сохранить спектральную деталь без ущерба для подавления шума. Оценка на ДУС3, SG-Mamba достигает конкурентоспособности или более высоких показателей по сравнению с сильными легковесными исходными показателями и достигает 13,091 дБ SI-