Компьютерная наука > Компютерное видение и распознавание шаблонов [представлено 17 декабря 2025 года (v1), последний пересмотренный вариант 15 сентября 2026 года (эта версия, v2)) Название: Multi-View Foundation Models View Vieve PDF HTML (экспериментальное) резюме: модели финансирования являются жизненно важными инструментами в различных компьютерных программах. Они используют в качестве ввода одно изображение RGB и выводят глубокое представление, которое полезно для различных приложений. Однако, если у нас есть несколько точек зрения на одну и ту же трёхмерную сцену, они действуют независимо от каждого изображения и не всегда создают последовательные характеристики для одной и той же точки. Мы предлагаем способ преобразования базовой модели в модель многовидового фонда. Такая модель принимает в качестве ввода набор изображений и выпускает карту характеристик для каждого изображения таким образом, чтобы характеристики соответствующих точек были максимально последовательными. Такой подход не учитывает необходимость создания последовательной 3D-модели характеристик и позволяет непосредственно манипулировать пространством изображения. В частности, мы показываем, как дополнить Трансформеры базовые модели (например, DINO, SAM, CLIP) промежуточными 3D-слоями внимания, которые помогают совместить характеристики различных точек зрения. В качестве примера можно привести обычные поверхностные оценки и задачи по сегментации с несколькими видами. Количественные эксперименты показывают,…
Модели фонда " Мультивидуум &qt;
arXiv: 2512.15708v2 Annualce Type: заменить резюме: модели фонда являются жизненно важными инструментами в различных компьютерных программах. Они используют в качестве ввода одно изображение RGB и выводят глубокое представление, которое полезно для различных приложений. Однако, если у нас есть несколько точек зрения на одну и ту же трёхмерную сцену, они действуют независимо от каждого изображения и не всегда создают последовательные характеристики для одной и той же точки. Мы предлагаем способ преобразования базовой модели в модель многовидового фонда. Такая модель принимает в качестве ввода набор изображений и выпускает карту характеристик для каждого изображения таким образом, чтобы характеристики соответствующих точек были максимально последовательными. Такой подход не учитывает необходимость создания последовательной 3D-модели характеристик и позволяет непосредственно манипулировать пространством изображения. В частности, мы показываем, как дополнить Трансформеры базовые модели (например, DINO, SAM, CLIP) промежуточными 3D-слоями внимания, которые помогают совместить характеристики различных точек зрения. Как ведущий экса