ЭМОДЕЙСКИЙ поток: эмоционально-учитываемое звукозаписывающее построение полнобортового движения
arXiv: 2609.16011v1 Тип уведомления: перекрестное резюме: для поддержания разговора нужны синхронизированные движения всего тела (жесты и выражения лица), которые соответствуют речи и эмоциональному состоянию. В мультимодальных моделях многоязыковых моделей успешно учитываются различные виды транспорта, однако они позволяют получать только языковые продукты и оставляют в них серьезный пробел. Мы идентифицируем провал эмоционального кондиционирования и реагируем на его сбой: как другие условные генераторы, которые недостаточно используют слабые сигналы кондиционирования, модель регулировки потока при наличии богатой аудиопривязки и дискретной эмоциональной этикетки подавляет эмоции, вызывая почти аналичное движение независимо от конкретных эмоций. Мы представляем EMODY Flow, легкую (около 35М параметров) систему матирования потока, которая прикрепляется к замерзшей модели Qwen-3 Omni и повторно использует внутренние аудиокоды Mimi для выведения двух параллельных генераторов DIT: один для SMPL-X позы тела, другой для выражения лица FLAME. Подсобный отдых для эмоций, относящийся к учебному времени