Компьютерная наука > Комплектное видение и распознавание шаблона [представлен 30 января 2026 (v1), последний пересмотренный вариант 16 сентября 2026 года (этот вариант, v4)] Название: ShotFinder: Imagation-Driven Open-Domain Video Retrieval через Интернет Поиск PDF HTML (экспериментальный) резюме: В последние годы крупные языковые модели (LMS) добились быстрого прогресса в поиске информации, однако существующие исследования были сосредоточены главным образом на текстовых или статических мультимодальных параметрах. Поиск видеозаписей с открытым доменом, который включает в себя более крепкую временную структуру и более сложную семантику, по-прежнему не имеет систематических контрольных показателей и анализа. Для заполнения этого пробела мы введем ShotFinder, ориентир, который формализирует требования к редактированию в качестве описаний снимков, ориентированных на ключи, и вводит пять типов контролируемых однофакторных ограничений: временный порядок, цвет, визуальный стиль, звук и разрешение. Мы покупаем 1210 высококачественных образцов из YouTube в 20 тематических категориях, используя крупные модели для поколения с человеческим контролем. Исходя из этого мы предлагаем ShotFinder, трехэтапный трубопровод поиска и локализации: 1) расширение запросов с помощью видео воображения; 2) поиск потенциальных видео-приборов с поисковой системой и 3) локализация на основе описания. Эксперименты с использованием моделей, основанных на использовании нескольких закрытых и открытых…
ShotFinder: Воображение - Driven Open-Domean Video Retrievale через Интернет Поиск
arXiv: 2601.23232v4 Тип уведомления: заменить перекрестное резюме: в последние годы крупные языковые модели (МЛМ) добились быстрого прогресса в поиске информации, однако существующие исследования были сосредоточены главным образом на текстовых или статических мультимодальных параметрах. Поиск видеозаписей с открытым доменом, который включает в себя более крепкую временную структуру и более сложную семантику, по-прежнему не имеет систематических контрольных показателей и анализа. Для заполнения этого пробела мы введем ShotFinder, ориентир, который формализирует требования к редактированию в качестве описаний снимков, ориентированных на ключи, и вводит пять типов контролируемых однофакторных ограничений: временный порядок, цвет, визуальный стиль, звук и разрешение. Мы покупаем 1210 высококачественных образцов из YouTube в 20 тематических категориях, используя крупные модели для поколения с человеческим контролем. Исходя из этого мы предлагаем ShotFinder, трехступенчатый трубопровод поиска и локализации: 1) расширение запросов с помощью видеообразия; 2) поиск потенциальных видео-приборов с поисковой системой и 3) d)