Что 30 000 часов эгоцентрического видео не учит
arXiv: 2610.12464v1 Annualce Type: New Human Brieflow: World Models предлагает многообещающую альтернативу физико-моделированным симуляторам, но пока еще далеко от практического развертывания. Мы задаемся вопросом, как далеко они попадают в эгоцентрическое видео человека с использованием набора данных 30 000 часов, охватывающих более 1000 типов сцен и 14000 участников. Вместо того, чтобы полагаться на непрозрачные показатели ниже по течению, мы непосредственно оцениваем агент и объект-интерактивность верность на сложном целевом параметре вне распределения. Увеличение числа данных о подготовке на 100x улучшает оба, но неравномерно: агент хорошо моделируется, в то время как точность объектов остается намного ниже и медленно совершенствуется. Мы показываем, что агентские выгоды не обязательно должны исходить из данных и тщательное визуализированное конструирование сатурирует верность с его долей, которая позволяет нам измерить достоверность объекта самостоятельно и обнаружить точку насыщения. Затем мы введем схему контроля, которая переключит мощность с внешнего вида на динамику объекта, улучшая верность объекту, хотя и существенный разрыв remai