Компьютерная наука > Компютерное видение и распознавание шаблона [представлено 2 сентября 2026 года] Название: Что на самом деле решает энкодер? Контролируемое сопоставление стволовых костей зрения на сегрегации деревьев и Stereo Deft View PDF HTML (экспериментальное) резюме: роботу-сёрнирующим деревьям нужно два факта по пикселю: принадлежит ли он дереву, а также его расстояние. Оба этих метода обычно получаются с помощью головок задач, прикрепляемых к опоре зрения, выбранной по репутации, а не методом измерения. Ведение набора данных, декодеров, потерь, графика и оценки, мы задаемся вопросом: как сильно выбор энокодера изменяет совместное семантическое сегментирование и глубину стереона тонкой растительности? Мы строим жесткую сеть разделения параметров, в которой один энкодер кормит обе ветви и обменивает только заказчик без корректировки внизу. Мы оцениваем кодеры в семьях архитектуры [М] (CNN, трансформаторы, гибриды, MLP-миксеры, государственные космические модели) около бюджета ~25M с нуля. Глубина оценивается только на древесных пикселях; для предотвращения сокращения «маркировки — все-дерево» в сегментации используются границы F1 и фоновые IOU. В этой связи выделяются три вывода. Во-первых, самые сильные кодеры - это гибридные и созвездивые, а не трансформаторы: [Лучший Энкодер] ведет с сегментацией mIOU и глубиной $\delta_1 долл., в то время как [X] трансформаторов обычного зрения падает при обучении с нуля. Во-вторых, число параметров не предсказывает качества --…
Что на самом деле решает энкодер? Контролируемое сопоставление спинных костей зрения на сегрегации деревьев и глубине стерео
arXiv: 2609.13232v1 Annualce Type: New Habstrate: Robon Surning Drees нуждается в двух фактах на пиксель: принадлежит ли он дереву и его расстояние. Оба этих метода обычно получаются с помощью головок задач, прикрепляемых к опоре зрения, выбранной по репутации, а не методом измерения. Ведение набора данных, декодеров, потерь, графика и оценки, мы задаемся вопросом: как сильно выбор энокодера изменяет совместное семантическое сегментирование и глубину стереона тонкой растительности? Мы строим жесткую сеть разделения параметров, в которой один энкодер кормит обе ветви и обменивает только заказчик без корректировки внизу. Мы оцениваем кодеры в семьях архитектуры [М] (CNN, трансформаторы, гибриды, MLP-миксеры, государственные космические модели) около бюджета ~25M с нуля. Глубина оценивается только на древесных пикселях; для предотвращения сокращения «маркировки — все-дерево» в сегментации используются границы F1 и фоновые IOU. В этой связи выделяются три вывода. Во-первых, самые сильные кодеры - это гибридные и композитные, а не трансформаторы: [Лучший Энкодер] ведет