Компьютерные науки > Расчеты и язык [представлен 10 июня 2026 (v1), последний пересмотренный вариант 8 октября 2026 года (эта версия, v2)) Заголовок: Подготовленные самоконтролированные модели речи могут распознавать невидимые совпадающие взгляды PDF HTML (экспериментальное резюме): Модерн, заранее подготовленные модели автоматического распознавания речевых сообщений, проходят подготовку по крупномасштабным аудиоданным для кодирования речи в контекстуальные представления. Вместе с тем их данные о профессиональной подготовке в значительной степени перекликаются с высокодоходными языками, при этом мало данных из низкоресурсных языков вызывает озабоченность по поводу потенциальной недопредставленности типологических необычного звука речи, например щелчковых совпадающих, главным образом на языках хойзана. Это приводит к нашему центральному вопросу: могут ли эти модели распознавать совпадающие звуки так же точно, как и другие слова? Для решения этого вопроса мы отладим и сравним заранее подготовленные модели речи (Wav2Vec2 и HUBERT) с данными, полученными на двух богатых кликами языках хоисана (Gusui and West!Xoon). Наши результаты показывают, что тонкие модели последовательно распознавают щелчки более точно, чем нещёчины, и предполагают, что самовидение позволяет обобщать звуки человеческой речи, включая редкие телефоны. История представления: Чихиро Тагути [видеть по электронной почте] [v1] Wed, 10 июня 2026 01:07:32 UTC (162 KB) [ v2) Thu, 8 октября 2026 06:36:41 UTK (161 KB)]…
Подготовленные самоконтролирующиеся модели речи могут распознавать невидимые совпадения.
arXiv: 2606.11542v2 Annuales Type: заменить резюме: современные модели самоконтроля за автоматическим распознаванием речи обучаются крупномасштабным аудиоданным, чтобы кодировать речь в контекстуализированные представления. Вместе с тем их данные о профессиональной подготовке в значительной степени перекликаются с высокодоходными языками, при этом мало данных из низкоресурсных языков вызывает озабоченность по поводу потенциальной недопредставленности типологических необычного звука речи, например щелчковых совпадающих, главным образом на языках хойзана. Это приводит к нашему центральному вопросу: могут ли эти модели распознавать совпадающие звуки так же точно, как и другие слова? Для решения этого вопроса мы отладим и сравним заранее подготовленные модели речи (Wav2Vec2 и HUBERT) с данными, полученными на двух богатых кликами языках хоисана (Gusui and West!Xoon). Наши результаты показывают, что тонкие модели последовательно распознавают щелчки более точно чем нещёчины, и это предполагает, что самовидение позволяет обобщать звуки человеческой речи