Использование голов OCR для ревертализации изображений

#Использование #Annulates #Type #Например

arXiv: 26009.18823v1 Annulates Type: кросс-бюллетень: Как картировать VLM от пикселей до семантики? Для понимания этого общего вопроса мы сосредоточимся на узком: изучении того, как VLM выполняют оптическое распознавание символов (OCR). В четырех моделях мы идентифицируем головы внимания, необходимые для OCR, и обнаруживаем, что на самом деле они являются головами общего назначения, которые выводят интерпретируемые семантические функции по всем символам изображения. Например, указание этих голов на символ с изображением, содержащим слово "байк", приводит к выходу Kwen3-VL-8B, но указывая их на крыло птицы, модель выводит символ "фазер". Мы разбиваем вес внимания этих голов в одну интерпретацию линз, которая обнаруживает интерпретация семантических характеристик в скрытом состоянии по всем слоям. В сочетании с проекцией в словарное пространство, мы можем получить интерпретируемые этикетки начиная со слоя 0, показывающие, что изображения на самом деле соответствуют языку ранних слоев. Мы находим это w