Целевые визуальные контрафактные пояснения для модели контрастного видения - языка
arXiv: 26009.37638v1 Annuate Type: New Brieftretary: Текущие методы объяснения контрастных моделей, таких как CLIP, в основном выявляют важные регионы без указания того, каким образом изменять ввод данных для получения целевого прогноза. Мы введём /textbf {M}ask-guided \textsterbf_A}Dapative…