Технический доклад Qwen-Audio-3.0 ASR
arXiv: 2609.07549v1 Аннонс Тип: новое резюме: в последние годы автоматическая распознавание речи (АСР) характеризовалась трансформационными достижениями, обусловленными тремя взаимодополняющими парадигмами: масштабирование данных, масштабирование моделей и глубокая интеграция с крупными языковыми моделями (ЛМБ). Однако преодоление разрыва между показателями академической деятельности и реальными производственными выгодами по-прежнему остается постоянной задачей, особенно в том, что касается использования различных региональных диалектов, динамичных структур и " горячих слов &qt; , распространения контекстуальной информации на большие расстояния и разрозненной спонтанной речи. В настоящем докладе мы представляем Qwen-Audio-3.0-ASR, основанную на смеси экспертов (MoE) систему АСР, предназначенную для удовлетворения этих производственных потребностей с помощью единой системы, обеспечивающей последующее обучение. Эта модель построена на основе костяшка Qwen, и она обучена десяткам миллионов часов крупномасштабных речевых данных. Qwen-Audio-3.0-ASR поддерживает транскрипцию на 30 языках и 16 китайских диалектных сортов, охватывающих восемь основных диалектовых регионов. За пределами