Компьютерная наука > Компютерное видение и распознавание шаблона [представлено 7 сентября 2026 года] Название:TDDN: Text-diffed Diffected Network for Pazzle View Vieve PDF HTML (экспериментальное) Резюме: Структурные визуальные рассуждения, такие как головоломки с изображениями, требуют тонкозернистого визуального восприятия, возможности нынешних моделей языка зрения (VLM). VLM, построенные на позвоночнике VIP, торгуют тонкозернистыми деталями для высокоуровневого семантика. И мы показываем эту потерю распространяющейся внизу. Для того, чтобы вернуть его, мы соединим представления DINOv3 и CleanDIFT в энкодер восприятия (Диффуздино) и приведем его к RoBERta-L, что даст текстосопоставимую модель TDDN, которая сохраняет это превосходство для восприятия: с замороженными позвонками и только парами корректировочных 590K, TDDN соответствует CLIP на поиске изображений и текстов, превысив ее на трех из четырех параметров. В то время как она делает это более чем втрое, густо предопределённая точность CLIP (ADE20K 5,20 долл. США до 18,11 млн долларов США, COCO-Staff 7,35 долл. ТРДН ведет работу по определению показателей сегментации среди общих целевых контрастных кодировок, включая SigLIP$2, долл. США2. Далее мы введем Puzzle Inseption — сегментацию и визуальный вопрос, отвечая на набор данных, который изучает тонкозернистые пространственно-пространственные понимания, которые TDDN удваивает точность сегментации CLIP (11,04 долл. США - 22,51 млн. долл. История представления: Debopriyo…
СТРН: Диффифицированная сеть DINO для понимания задач
arXiv: 2609.07937v1 Annuate Type: New Brieflow: Структурированная визуальная аргументация, такая как головоломки с изображением, требует тонкозернистого визуального восприятия, а также недостатка возможностей нынешних моделей языка зрения (VLM). VLM, построенные на позвоночнике VIP, торгуют тонкозернистыми деталями для высокоуровневого семантика. И мы показываем эту потерю распространяющейся внизу. Для того, чтобы вернуть его, мы соединим представления DINOv3 и CleanDIFT в энкодер восприятия (Диффуздино) и приведем его к RoBERta-L, что даст текстосопоставимую модель TDDN, которая сохраняет это превосходство для восприятия: с замороженными позвонками и только парами корректировочных 590K, TDDN соответствует CLIP на поиске изображений и текстов, превысив ее на трех из четырех параметров. В то время как она делает это более чем втрое, густо предопределённая точность CLIP (ADE20K 5,20 долл. США до 18,11 млн долларов США, COCO-Staff 7,35 долл. ТРДН ведет работу по определению показателей сегментации среди общих целевых контрастных кодировок, включая SigLIP$2, долл. США2. Мы также представляем Puzzle Inclusion, se