Нет необходимости в дистилляции: один-пасс, говорящие головки в режиме реального времени с помощью акаузального шума
arXiv: 2610.101070v1 Annuate Type: New Humber Abstract: Audio-Lace Animation поддерживает аватары в режиме реального времени, телепрезентативность и воплощение виртуальных агентов. И он должен работать в режиме онлайн: каждая кадра, испускаемая звуком до текущего времени, с интерактивными темпами. В последнее время в большинстве случаев используются модели распространения, которые требуют проведения большого числа сетевых оценок по каждой выборке и поэтому не подходят для использования в качестве источника данных. Мы утверждаем, что в этой области нет необходимости расходовать средства. Аудиоусловленное движение лица занимает относительно низкомерный коллектор, режим, в котором достаточно однопроходного GAN. Препятствием является не вместимость, а стохастическая структура. Мы показываем, что причинно-временный генератор под воздействием звука i.i.d не может подавлять свой выходной спектр в группе без разрушения ее новаторства на шаг. Мы предложили FaceGAN, который растворил ограничение путем создания звукового пути акаузально. Поскольку звук вождения синтетичен, его будущее можно отобрать сейчас, так что путь к выражению остается причинным.