СлотДит: объектно-центральные представления для Difclusion Transformers

#СлотДит #Difclusion #Transformers #Annuate #Type

arXiv: 2609.17414v1 Annuate Type: New Humber Brief: Текстоусловные скрытые модели диффузии сильно работают в видео генерации и являются перспективными позвонками для роботизированных прикладных программ. Вместе с тем существующие подходы основаны на латентных представлениях уровня пикселя или VAE, которые не имеют явной семантической структуры и оставляют воздействие представительного пространства в значительной степени незатронутым. Объектно-центрические представления на основе слота предлагают структурированную альтернативу, разлагая сцены в латентные снимки уровня объекта или прорези. Хотя они продемонстрировали успех в разработке динамических моделей и планировании, пока еще не изучены возможности их использования для разработки на основе диффузных методов. Мы представляем SlotDiT, текстовый Difsusion Transformer (DIT), который работает в латентном пространстве на основе слота. С учетом исходного изображения и языкового обучения, SlotDiT размещает сцену в объектно-центрические слоты, представляющие отдельные объекты. При условии подготовки и наблюдения контекста сцены модель авторегрессивно деноза в будущем

Компьютерная наука > Компютерное видение и распознавание шаблонов [представлено 15 сентября 2026 года] Название: SlotDiT: Объект-Centriral Freements for Difcision Transformers View PDF HTML (экспериментальное) Резюме: Скрытые модели распространения данных с последующим условием работают очень активно в видеоформатировании и являются перспективными позвонками для роботизированных приложений. Вместе с тем существующие подходы основаны на латентных представлениях уровня пикселя или VAE, которые не имеют явной семантической структуры и оставляют воздействие представительного пространства в значительной степени незатронутым. Объектно-центрические представления на основе слота предлагают структурированную альтернативу, разлагая сцены в латентные снимки уровня объекта или прорези. Хотя они продемонстрировали успех в разработке динамических моделей и планировании, пока еще не изучены возможности их использования для разработки на основе диффузных методов. Мы представляем SlotDiT, текстовый Difsusion Transformer (DIT), который работает в латентном пространстве на основе слота. С учетом исходного изображения и языкового обучения, SlotDiT размещает сцену в объектно-центрические слоты, представляющие отдельные объекты. При условии подготовки и наблюдения контекста сцены модель авторегрессивно определяет будущие траектории слота для прогнозирования динамики сцен. Для систематического изучения латентного космического дизайна для диффузионных трансформаторов мы сопоставляем представления…