Адаптация MLLM для нуэнсированного видео-ретриваля

#Адаптация #MLLM #Annulates #Type #Наша

arXiv: 2512.13511v4 Annulates Type: заменить резюме: Наша цель - создать модель, в которой будут отражены нюансовые связи между поиском запросов и видео-кандидатами. Мы охватили три аспекта поиска: i) временные, ii) отрицания и iii) мультимодальные. Для временны́х нюансов мы считаем, что ширальные действия должны различаться между временными противоположными действиями как "открытие двери" и "закрывание двери". Для отрицания мы рассматриваем вопросы с такими негаторами, как "нет", "не" которые позволяют пользователю указывать то, чего они не хотят. Для мультимодального нюанса мы рассматриваем задачу сводного поиска, когда запрос состоит из видео вместе с инструкциями по редактированию текста. Цель состоит в разработке единой модели внедрения, которая эффективно урегулирует такие нюансы. С этой целью мы переделаем мультимодальную модель Большого языка (MLM), обученную для создания текста встроенной модели. Мы исправляем его контрастной потерей только на тексте с тщательно отобранными жесткими негативами, которые доставляют th