SCOUT: " Сим-айл-третье текстовое лицо, ретроспективно-показательное прогнозирование по замороженным видеочастотам

#SCOUT #Сим-айл-третье #Annuaire #Type #Habstrate

arXiv: 2609.19483v1 Annuaire Type: New Habstrate: Text- persons recess in a sim-to-real displace (синтетические данные о подготовке кадров, реальная галерея) обычно рассматриваются с помощью дорогостоящих кросс кодировок. Мы спрашиваем, может ли система замороженного навоза конкурировать. Мы представляем SKUT, который представляет собой межмодальный поиск как предсказание в пространстве. Тренируемый прогнозор показывает пятна замороженного видео-кодера в месте для размещения замороженного текстового энкода под двунаправленной целью InfoNCE, и ни один экзодер не отточен в базовой модели. Видеоконсервир V-JEPA, текстовый энкодер EmbendingGemma и прогнозор инициализирован с дешифра Qwen3.5-0.8B. Мы делаем три вывода. Во-первых, лучший замороженный текстовой кодер - это просто тот, геометрия которого лучше подходит для видео. Бесплатная оценка соответствия определяет три потенциальных текстовых кодера в том же порядке, что и их точность поиска на нашем блоке (Spearman $rho = 1.0 долл. США); четвертый энкодер LLM показывает

Компьютерные науки > Компютерное видение и распознавание шаблона [представлено 16 сентября 2026 года] Название: SCUT: Sim-to-Real Text-Personal Retrievaly by Embending-Space Provision of Frozen Video Fatures View PDF HTML (экспериментальное) Резюме: Поиск данных о человеке на базе Texts в рамках сим-реального пробела (синтетические данные подготовки, реальная галерея моделирования), как правило, осуществляется при помощи дорогостоящих кросскодеров. Мы спрашиваем, может ли система замороженного навоза конкурировать. Мы представляем SKUT, который представляет собой межмодальный поиск как предсказание в пространстве. Тренируемый прогнозор показывает пятна замороженного видео-кодера в месте для размещения замороженного текстового энкода под двунаправленной целью InfoNCE, и ни один экзодер не отточен в базовой модели. Видеоконсервир V-JEPA, текстовый энкодер EmbendingGemma и прогнозор инициализирован с дешифра Qwen3.5-0.8B. Мы делаем три вывода. Во-первых, лучший замороженный текстовой кодер - это просто тот, геометрия которого лучше подходит для видео. Безупречная оценка соответствия показывает, что правило зависит от метрики и поддерживается для оценки перекодировки района ($rho = 0,8 долл. США), но не для линейного зонда (\ rho= -0,2 долларов). Во-вторых, два рычага с точными целями: оптимизация экзодра с помощью параметра ExPLORA и бестренировочный атрибутор, построенный на модели языка зрения, улучшают точность верхнего ранга, которая в противном случае ограничивает…