RT-DETRv4: Бесболезненное содействие обнаружению объектов в реальном масштабе времени с помощью моделей, используемых для создания системы зрения
arXiv:2510.25257v2 Annuales Type: заменить резюме: обнаружение объектов в реальном масштабе времени позволило добиться существенного прогресса благодаря тщательно разработанной архитектуре и стратегиям оптимизации. Вместе с тем стремление к быстродействующему выводу на основе легкой конфигурации сетей часто приводит к ухудшению представленности характеристик, что препятствует дальнейшему повышению эффективности работы и практическому развертыванию устройств управления. В настоящем документе мы предлагаем экономически эффективную и высоко адаптируемую систему дистилляции, которая позволяет использовать быстро эволюционирующий потенциал моделей Vision Foundation (VFM) для совершенствования устройств обнаружения легких объектов. С учетом значительных архитектурных и учебных объективных различий между ДФМ и ресурсоснабженными детекторами достижение стабильной семантической передачи данных, учитывающей конкретные задачи, является сложной задачей. Для решения этой проблемы, с одной стороны, мы введем модуль intextbf {Deep Semantic Inguor (DSI)}, который облегчает интеграцию высокоуровневых представлений VFM в глубокие слои детектора. В отношении