RT-SEMamba: " Укрепление речей в реальном масштабе времени &qt; мамба посредством прогрессивной дистилляции знаний

#RT-SEMamba #Укрепление #Annuales #Type #MambA

arXiv: 2608.12099v2 Annuales Type: заменить перекрестное резюме: Мы представляем RT-SEMamba, полностью причинно-следственную модель улучшения речи (SE), разработанную на основе когнитивных блоков MambA. В отличие от трансформаторных архитектур, которые опираются на растущие кэши с ключевым значением, Мамба распространяет постоянное состояние в каждом слое, что позволяет сделать вывод о длительности формы с точки зрения памяти и пропускной способности. Кроме того, мы внедряем прогрессивную стратегию дистилляции знаний (КД), которая сжимает восьмислойного учителя в мелко-полуголового ученика путем совместного разложения сложных спектральных результатов и промежуточных представлений. На Voicebank-DEMAND восьмислойная RT-SEMamba достигает 3,32 PESQ с 25 мС алгоритмическим ограничением запоздалости, а дистиллированный однослоевый студент улучшает наивную базу 1 с 3,06 до 3,18 ПЕСК при сохранении того же устойчивого уровня RTF, обеспечивая 2,64x ускорение над учителем. Эти результаты свидетельствуют о том, что государственные космические модели с прогрессивным KD обеспечивают конкурентоспособный компромисс по качеству

Компьютерная наука > Звук [представлен 12 августа 2026 (v1), последний пересмотренный вариант 16 сентября 2026 года (эта версия, v2)) Название: RT-SEMamba: Real Time Response Advention Mamba посредством прогрессивного дистилляции знаний PDF HTML (экспериментальный) Резюме: Мы представляем модель RT SemambA — полностью причинно-следственное улучшение речи (SE), построенную на когнитивных блоках временнóй частоты Mamb. В отличие от трансформаторных архитектур, которые опираются на растущие кэши с ключевым значением, Мамба распространяет постоянное состояние в каждом слое, что позволяет сделать вывод о длительности формы с точки зрения памяти и пропускной способности. Кроме того, мы внедряем прогрессивную стратегию дистилляции знаний (КД), которая сжимает восьмислойного учителя в мелко-полуголового ученика путем совместного разложения сложных спектральных результатов и промежуточных представлений. На Voicebank-DEMAND восьмислойная RT-SEMamba достигает 3,32 PESQ с 25 мС алгоритмическим ограничением запоздалости, а дистиллированный однослоевый студент улучшает наивную базу 1 с 3,06 до 3,18 ПЕСК при сохранении того же устойчивого уровня RTF, обеспечивая 2,64x ускорение над учителем. Эти результаты свидетельствуют о том, что модели государственного пространства с прогрессивным KD обеспечивают конкурентоспособный компромисс по качеству для SE в режиме реального времени. История представления с: Rong Chao [видение электронной почты] [v1] Wed, 12 августа 2026 14:21:05 UTC (303 KB) […