SepGen: Многослойное дифференциальное аудио-видео и поколение в единой модели
arXiv: 2610.11361v1 Annuales Type: кросс-бюллетень: 4D аудиовизуальная сцена включает видео, динамическую геометрию и источники звуков, которые ее изображают, каждый со своим собственным расположением и траекторией. Для получения такой сцены с новой точки зрения необходимо, чтобы каждый источник был доступен в виде индивидуальной волны, с тем чтобы он мог быть локализован на месте преступления и распространен среди наблюдателя до смешивания сигналов. Совместные аудио-видеогенераторы могут синтезировать видео и его саундтрек, однако звуковая дорожка излучается в виде единой звуковой смеси, при которой источники не являются доступными по отдельности. Мы представляем SepGen, который расширяет заранее подготовленный аудио-видеогенератор для испускания видеокассеты, смешанной саундтрекной дорожки и одной волновой модели на один подзаголовок в одном совместном пробеге отбора проб. SepGen поддерживает два дополнительных режима: поколение и разделение. В режиме поколения каждый субтитрь источника указывает, что его стебель содержит. Например, диалог между двумя ораторами выходит в качестве одного ствола на каждого оратора или