VoiceTrace: Контрольная и ретровиумная основа для возврата речи
arXiv: 2609.18521v1 Annuature Type: кросс-бюллетень: Поиск речей становится все более важным, поскольку содержание выступлений продолжает расти в ходе встреч, лекций, подкастов и видео. Существующие критерии и модели позволили усовершенствовать семантический поиск по разговорному содержанию, но в основном сконцентрировались на том, что говорится, при этом проигнорировав его. Однако во многих реальных сценариях пользователи должны получать слова, основанные на семантической составляющей и целевом ораторе, где речь может быть определена естественным образом не предопределённым, а референтной речью. Для устранения этого пробела мы введем текст /textbf {VoiceTrace-Bench}, контрольный параметр для поиска речи с помощью гибридных формулировок, где каждый запрос сочетает текст, указывающий на значение \empha {что}, чтобы получить со ссылкой на речь, указывающую ~mhF'thyll't who to treat. Эта система требует использования моделей для интеграции дополнительной семантической и речевой информации непосредственно из разнородных источников запросов. Мотивируется совместным аудиотекстовым моделированием