Дискетирование структуры представительства в Трансформаторах зрения: злостное архитектурное исследование
arXiv:2610.11205v1 Annualce Type: New Habstratement: Prepositation Statures for governing Vision Transformer (ViT) and their generalization pervision. Вместе с тем в предыдущих исследованиях не были выделены или проанализированы элементы уровня модуля и не изучалось, каким образом их взаимодействие способствует оценке эффективности. В этой работе мы проводим первый тщательный анализ информации о характеристиках в различных архитектурных масштабах, эмпирически выявляем связь между представлением VIT и поведением обобщения, а также используем эти знания для руководства эффективным дизайном Vit. Мы вносим пять вкладов: по различным архитектурным шкалам, 1) мы выявляем коллапс характеристик при инициализации, что приводит к дубликату, и предлагаем схему сокращения для смягчения этой проблемы. 2) Мы подсчитали характерную информацию с использованием энтропии и минимальной эйгенной ценности, показав, что эти метрики служат надежными индикаторами прогнозирования обобщения. 3) Мы показываем эту черту в символе