Конкорд: Видеоотношение алгебра для меж-модальной оптимизации запросов
arXiv:2609.057556v1 Annuate Type: перекрестное резюме: Семантические видеозапросы позволяют пользователям вводить естественные языки, стимулирующие и использующие мультимодальные модели большого языка (MLMs) для устного перевода видео. Такие запросы становятся все более популярными для запроса видеоданных. Однако их экспрессивность связана с большими расходами: MLLM может обрабатывать часы работы СМИ, чтобы вернуть всего лишь секунды соответствующей продукции, что делает наивное исполнение медленным, дорогостоящим и неточным. Мы предлагаем Конкорд, систему выражения и оптимизации семантических видеозапросов. Мы делаем три взноса. Во-первых, мы введем Video Raining Algebra (VRA), гнезденную алгебру над видеозаписями, стенограммами, рамками и предметными следами, которые отражают обычные семантические видео операции. Во-вторых, мы выбираем набор приблизительных оптимизаций для перезаписи запросов VRA в целях сокращения использования MLM при одновременном повышении качества результатов. Для записи видео Конкорд либо обрабатывает стенограммы вместо видео, либо использует их для идентификации видеоклипов для обработки MLLM. Для поперечной камеры q