Синхронизация: простое и эффективное автоматизированное видео-поглощение с помощью ТТС с улучшенным зрением
arXiv: 2512,05126v2 Annuales Type: заменить кросс-бюллетень: Автоматическое видеозапугивание имеет целью генерировать высокодостоверную речь, которая во времени соответствует визуальному содержанию. Однако существующие методы по-прежнему страдают от ограниченной речи, недостаточной аудиовизуальной синхронизации и низкой масштабируемости за пределами моноязычных рамок. Для решения этих проблем мы предлагаем SyncVoice, простую и эффективную систему опрокидывания, которая легко интегрирует текстово-визуальный модуль фьюзиона в предварительно обученную систему передачи текста на язык (TTS). Этот модуль увязывает визуальные функции с лингвистическими представлениями, обеспечивая возможность синхронизированного во времени синтеза речи без сложного архитектурного перепроектирования. Эксперименты на наборе данных LRS3 показывают, что SyncVoice достигает самых современных показателей при нулевом проигрыше. Дальнейшая подготовка по широкому двуязычному набору аудиовизуальных данных способствует повышению степени достоверности голосового голоса при сохранении синхронизации, обеспечивая единую унифицированную модель для китайского и английского языков.