В конце прошлого года мы представили семейство моделей генерации изображений и видео Kandinsky 5.0. Флагманская модель Kandinsky 5.0 Video Pro заняла и до сих пор удерживает первое место среди open-source-моделей в категории text-to-video на arena.ai. Сегодня мы выкладываем в открытый доступ Kandinsky WM 1.0, набор из трех специализированных моделей генерации видео: для автомобильных сценариев, робототехники и сцен со сложной физикой. Код и веса под лицензией MIT: GitHub, GitVerse, HuggingFace.
WM расшифровывается как World Model, то есть «модель мира». Этот термин используют довольно широко, поэтому здесь важно уточнить, что именно мы имеем в виду. Фэй-Фэй Ли (ведущий исследователь в области компьютерного зрения, инициатор проекта ImageNet) с командой World Labs предлагает классифицировать модели мира по функции. В этой схеме renderer отвечает за наблюдение — например, за кадры видео; simulator — за состояние и динамику мира; planner — за выбор следующего действия. Эти функции могут быть представлены разными системами или сочетаться в одной. Конечно же сочетать все три функции в одной модели — это dream, к которой стремятся исследователи и инженеры (фактически, это и будет foundation world model для Physical AI систем)
По этой классификации Kandinsky WM 1.0 — renderer: на вход модели получают первый кадр и текстовое описание, а на выходе строят визуальное продолжение сцены. Для задач Physical AI при этом недостаточно, чтобы видео просто выглядело правдоподобно: модель должна…
Д…