USPLIT-VQA: Учеба в режиме U-Shared Split для Визуальных вопросов с помощью весовой агрегации

#USPLIT-VQA #Учеба #U-Shared #Split #Визуальных

arXiv:2609.12168v1 Annuate Type: New Express: Visual Question Response (VQA) Systems, совместно интерпретируя изображения и вопросы на естественном языке, имеют значительные перспективы во многих областях, однако конфиденциальный характер данных пользователей создает фундаментальное препятствие. Централизованная подготовка требует доступа ко всем данным, в то время как федеральное обучение предполагает наличие у каждого клиента полной модели. Мы предлагаем USPLIT-VQA - систему разделения знаний в форме U для сохранения конфиденциальности VQA, в которой каждый клиент сохраняет первоначальные слои и классификационную главу, а сервер содержит вычислительные тяжелые промежуточные слоя, сохраняя исходные данные и этикетки на устройстве клиента. Кроме того, мы внедряем механизм оценки клиентов на основе градиентной схожести, предназначенный для уменьшения влияния злонамеренных обновлений. Эксперименты на четырех наборах данных VQA (VQA-RAD, SLACE, PathVQa и VizWiz) с двумя позвонками свидетельствуют о повышении точности по сравнению с Federated Learning for the Torge m

Компьютерная наука > Компютерное видение и распознавание шаблона [представлено 10 сентября 2026 года] Название: USPLIT-VQA: U-Shared Split Study for Visual Question Approaching with Invest-Agregated Agгрегация PDF HTML (экспериментальное) Резюме: Системы ВИЗУАЛЬНЫХ вопросов, совместно интерпретирующие изображения и запросы на естественные языки, имеют значительные перспективы во многих областях, однако конфиденциальный характер данных пользователей создает фундаментальное препятствие. Централизованная подготовка требует доступа ко всем данным, в то время как федеральное обучение предполагает наличие у каждого клиента полной модели. Мы предлагаем USPLIT-VQA - систему разделения знаний в форме U для сохранения конфиденциальности VQA, в которой каждый клиент сохраняет первоначальные слои и классификационную главу, а сервер содержит вычислительные тяжелые промежуточные слоя, сохраняя исходные данные и этикетки на устройстве клиента. Кроме того, мы внедряем механизм оценки клиентов на основе градиентной схожести, предназначенный для уменьшения влияния злонамеренных обновлений. Эксперименты по четырем наборам данных VQA (VQA-RAD), SLACE, PathVQА и VizWiz) с двумя позвонками свидетельствуют о повышении точности по сравнению с Federated Learning for the Treaty Model и снижении точности для BiomedCLIP в рамках оцениваемого фиксированного разделения наряду со снижением памяти клиентов до 5,8X и сокращением связи до 10,8Х. С одним злонамеренным клиентом CAWA уменьшает влияние…