arXiv Computer Vision
СлотДит: объектно-центральные представления для Difclusion Transformers
arXiv: 2609.17414v1 Annuate Type: New Humber Brief: Текстоусловные скрытые модели диффузии сильно работают в видео генерации и являются перспективными позвонками для роботизированных прикладных програ...
arXiv Computer Vision