Компьютерные науки > Компютерное видение и распознавание шаблонов [представлено 15 сентября 2026 года] Название: Унификация семантических приоров и следов высокой степени активности: усиление V-JEPA с комбинацией экспериментальных экспериментов для густонаселенной синтетической криминалистики, просмотр PDF HTML (экспериментативно) Резюме: Неконтролируемое распространение манипулируемых изображений на платформах социальных сетей привело к увеличению распространения дезинформации, что создало серьезную угрозу общественному доверию и целостности информации. Современные глубоководные детекторы, как правило, опираются на Vision Transformers (ViTs), чтобы зафиксировать низкоуровневые несоответствия, характерные для полностью синтетических или местных изображений. Однако глобального понимания таких базовых моделей недостаточно для того, чтобы в одиночку проводить различие между реальным и поддельным мультимедийным контентом, особенно при сложных сценариях, когда изображения сжимаются или передаются через социальные сети. В этом документе мы впервые стали применять модели Совместной архитектуры прогнозирования (СИП) для глубокого обнаружения, используя общее представление о визуальной реальности, которое было продемонстрировано такими мировыми моделями. Мы предполагаем и эмпирически демонстрируем, что внутреннее мировое понимание моделей JEPA может быть использовано в качестве сильного предшествователя для глубокого детектора. Для того чтобы в полной мере использовать возможности…
Унификация семантических приводов и следов высокой степени вероятности: усиление V-JEPA с смешиванием экспертных судмедэкспертов, занимающихся интенсивной синтезированной картографией
arXiv: 2609.16778v1 Annualce Type: New Humber Abstract: Неконтролируемое распространение изображений в социальных сетях привело к увеличению распространения дезинформации, создавая серьезную угрозу общественному доверию и целостности информации. Современные глубоководные детекторы, как правило, опираются на Vision Transformers (ViTs), чтобы зафиксировать низкоуровневые несоответствия, характерные для полностью синтетических или местных изображений. Однако глобального понимания таких базовых моделей недостаточно для того, чтобы в одиночку проводить различие между реальным и поддельным мультимедийным контентом, особенно при сложных сценариях, когда изображения сжимаются или передаются через социальные сети. В этом документе мы впервые стали применять модели Совместной архитектуры прогнозирования (СИП) для глубокого обнаружения, используя общее представление о визуальной реальности, которое было продемонстрировано такими мировыми моделями. Мы предполагаем и эмпирически демонстрируем, что внутреннее мировое понимание моделей JEPA может быть использовано в качестве сильного p