Компьютерная наука > Расчет и язык [представлен 15 июля 2026 года] Название: Myovox: Чтение речи из мышечной части Face View PDF HTML (экспериментальный) Резюме: Miovox, мио (мускул) и vox (фактура), декодирование текста на английском языке с 31-канальной поверхностной электромиографии (SEMG), записанной от мышц лица во время голосовой речи. В ней используется один предмет emg2speech General Corpus с опубликованных 51,17% погрешности слов до 18,53% в трех отдельных движениях, каждый из которых измеряется изолированно. Во-первых, я восстанавливаю параметры открытого вокала, отсутствующие из публичного релиза и достигающий верной 40,63% WER/ 39,02% PER, чей показатель погрешности телефона соответствует 0.8 очкам, поэтому акустическая модель воспроизводится точно. Во-вторых, я заменяю причинно-следственный энкодер двунаправленным конформатором, обученным четырехкратной интермодальной дистилляции против параллельного звукового слоя 9, достигая 26,14% WER 22,34% PER только от электромиографии. В-третьих, я обобщаю две акустические модели, соединяю их многомасштабные списки n-лучших и перепровожу с классической моделью QLORA 7B, достигающей 18,53% WER, наилучший результат по этому корпусу, хотя не самый лучший для SEMG в тексте на другой корпорации (раздел 2). Затем я сообщаю о отрицательном результате, который ограничивает весь подход: перерейс исчерпан на 18,5 процента потому что связующим фактором является частота ошибки электромиографического акустического телефона (~20,9%), а…
Миовокс: чтение речи из мышечных мышц лица
arXiv:2609.17548v1 Аннонс Тип: новое резюме: Myovox, из мио (мускула) и vox (счета), декодирует текст на английском языке с 31-канальной поверхностной электромиографии (SEMG), записанный от мышц лица во время голосовой речи. В ней используется один предмет emg2speech General Corpus с опубликованных 51,17% погрешности слов до 18,53% в трех отдельных движениях, каждый из которых измеряется изолированно. Во-первых, я восстанавливаю параметры открытого вокала, отсутствующие из публичного релиза и достигающий верной 40,63% WER/ 39,02% PER, чей показатель погрешности телефона соответствует 0.8 очкам, поэтому акустическая модель воспроизводится точно. Во-вторых, я заменяю причинно-следственный энкодер двунаправленным конформатором, обученным четырехкратной интермодальной дистилляции против параллельного звукового слоя 9, достигая 26,14% WER 22,34% PER только от электромиографии. В-третьих, я соберу две акустические модели, объединю их многомасштабные и лучшие списки и перепровожу с QLORA-fi