CREP: Редкое позиционное кодирование ожидаемого проигрыша для единого видео поколения, контролируемого Камера
arXiv:2605.12938v2 Annuales Type: заменить Резюме: Video World Models должны предсказывать будущее появление таким образом, чтобы это по-прежнему соответствовало структуре сцены 3D, движению камеры и геометрии объективов. Однако существующие коды камеры уровня внимания либо описывают каждый символ…