#CLIP

28 статей
arXiv Machine Learning
arXiv Machine Learning

Гиперболическая латентная геометрия для сетей прототипов, построенных на деревьях: локальный и глобальный компромисс

arXiv:2608.25199v1 Аннотация: Мы изучаем регуляризатор с древовидной структурой по сравнению с макетами классовых прототипов в иерархической модели классификации и спрашиваем, влияет ли выбор скрытого...

arXiv Machine Learning
1
Читать
arXiv Computer Vision
arXiv Computer Vision

Что ускоряет изменения в обучении? Анализ концепции естественного языка моделей видения-языка

arXiv:2608.24142v1 Краткое описание: Быстрое обучение адаптирует модели языка зрения, такие как CLIP, оптимизируя непрерывные быстрые векторы, но полученные подсказки трудно интерпретировать на естест...

arXiv Computer Vision
1
Читать
arXiv AI
arXiv AI

Жираф: архитектура отображения от скрытых текстовых представлений до визуальных вложений для эффективного графического дизайна

arXiv:2608.23970v1 Мультимодальные большие языковые модели (MLLM) достигли значительного прогресса в понимании и интерпретации мультимедийного контента. Однако их способность генерировать меня-диа ост...

arXiv AI
1
Читать
arXiv Computer Vision
arXiv Computer Vision

PEAfowl: улучшенное восприятие многовидового видения-языка-действие для бимануальной манипуляции

arXiv:2601.17885v2 Бимануальные манипуляции в загроможденных сценах требуют политики, которая остается стабильной при окклюзии, изменениях точки зрения и вариациях сцены. Существующие модели действий ...

arXiv Computer Vision
1
Читать
arXiv Computer Vision
arXiv Computer Vision

Адаптация плотных отношений видения и языка для многозначной классификации с частичной меткой

arXiv:2608.22313v1 Изучение классификации изображений с несколькими метками с неполными аннотациями является сложной задачей, которая была широко изучена для ее превосходного компромисса между высокой...

arXiv Computer Vision
1
Читать
arXiv Computer Vision
arXiv Computer Vision

SketchFlow: генерация векторов с нулевым снимком через GMM Prior Flow в латентном пространстве CLIP

arXiv:2608.21659v1 Новые абстрактные эскизы векторов остаются одним из самых кратких и непосредственных средств абстрактного человеческого выражения. Тем не менее, создание высококачественных векторны...

arXiv Computer Vision
1
Читать
arXiv AI
arXiv AI

Чему учит CLIP для региональной геолокализации? Изучение визуальных сигналов и конфигурации сцены после адаптации

arXiv:2608.21761v1 Большие коллекции изображений уличного вида предоставляют богатую визуальную информацию о городской среде, но извлечение мелкозернистой географической информации из таких данных ост...

arXiv AI
1
Читать
arXiv NLP
arXiv NLP

Когда лучшие учителя не делают лучших учеников: пересмотр дистилляции знаний для моделей CLIP в VQA

arXiv:2511.17886v2 Анонс Тип: замена-кросс Абстракт: Модели языка видения (VLM) достигли значительного успеха в мультимодальных задачах, но их существенные вычислительные требования препятствуют эффек...

arXiv NLP
1
Читать