Visual Introduction and Its Framing Affect Attribute Описание, подготовленное крупными моделями зрения-лангуажа
arXiv: 2609.18345v1 Annuate Type: New Humber Brieflow: Большие модели языка зрения (LVMS) обычно используются только с одним текстом в качестве ввода, или плюс изображение. В настоящем документе мы продемонстрировали, что в тех случаях, когда изображение существует, даже если бы текст был готов не о конкретном случае (а только о концепции, к которой он принадлежит) с этой точки зрения, реакция на него по-прежнему будет затронута. Например, когда текст приводит в действие только с просьбой дать описание свойств породы собаки, изображение конкретной собаки из этой породы изменит реакцию. Кроме того, то, как этот конкретный пример составлен на этом образе, будет определять направление реакции. Подробный анализ также показывает, что в ответе физические термины увеличиваются с 18% только для текстовых материалов до 45% (40%) для тематических (ситуационных) структур. В целом, неожиданное воздействие визуальных сигналов на LVLM подчеркивает необходимость понимания присутствия изображения и его обрамления при оценке надежности LVNM.