3DHarnessBench: Проверка регентских 3-D-кодексных возможностей моделей пограничного обзора и языка

#Проверка #D-кодексных #Annualce #Type #Blender

arXiv:2609.06535v1 Annualce Type: новый резюме: мы введем 3DHarnessBench, эталонный показатель для оценки ассистентной способности моделей пограничного языка зрения (VLM) восстановить трехмерную геометрию как код Blender Python из различных источников. В отличие от предыдущих рамок, которые стимулировали VLM с фиксированным входом (например, однократное воспроизведение или текстовое описание), 3DHarnessBench оценивает четыре отдельных настройки жгута, которые постепенно позволяют проводить активную агентическую разведку, чему способствует недавнее функционирование Blender MCP. Наша иерархия от Sing-view, Multi-vision, Active Visual (произвольный доступ к точки зрения) и Full 3D Communication (полный доступ к целевому объекту через звонки функции Blender) проверяет способности моделей как визуальное восприятие, так и активные выводы, вызов инструментов и самокорректирование. Мы наблюдаем, что способность всех пограничных моделей восстанавливать 3D геометрию значительно улучшается при более широком доступе к звонкам, хотя усовершенствования сильно зависят от модели и ревеа.