CS-CLIP: Сценарий с граф-руководителем CLIPS для обоснования состава
arXiv: 26009,08242v1 Annuate Type: New Humber: Vision-Language Models (VLMs) демонстрирует высокую эффективность в рамках композиционных критериев, которые требуют рассуждения по поводу семантических возмущений объектов, атрибутов, отношений и их взаимодействия. Однако наш контролируемый анализ показывает, что существующие НОУ, созвучные составу, демонстрируют отклонения в отношении конкретных элементов, зачастую неудовлетворительно функционирующие ванильный CLIP по некоторым составным элементам. Для решения этой проблемы мы предлагаем использовать графики сцены для определения составных элементов и построения структурированных негативных через выборочную маскировку. Мы далее сохраняем негативы, которые наиболее противоречивы с оригинальным субтитром, вынуждая модель полагаться на составную структуру, а не поверхностные сигналы. CS-CLIP позволяет добиться самых современных композиционных рассуждений с высокой производительностью по всем составным элементам. Кроме того, в нем сохранены общие возможности для изучения языка зрения, такие как перекрестный поиск информации