СПАРТА: Синтетический контрольный параметр для оценки пространственного интеллекта в моделях Visual Foundation
arXiv: 2601.11729v3 Annuales Type: заменить резюме: Visual Foundation Models (VFM), такие как DINO и CLIP, преуспевают в семантическом понимании изображений, но демонстрируют ограниченные возможности пространственного рассуждения, что ограничивает их применимость для воображаемых систем. В результате в ходе недавно проведенной работы в программу подготовки по вопросам ВФМ включены некоторые задачи 3D (такие, как оценка глубины). Вместе с тем показатели использования ВФМ остаются непоследовательными по отношению к другим пространственным задачам, в связи с чем возникает вопрос о том, действительно ли эти модели обладают пространственной осведомленностью или чрезмерно соответствуют конкретным целям 3D. Для решения этого вопроса мы введем базовый показатель по задаче распознавания пространственных связей (SpaRTa), который позволяет оценить способность VFM определять относительные позиции объектов на образе. В отличие от традиционных целей 3D, которые сосредоточены на точном метрическом прогнозировании (например, оценка естественной поверхности), СПАРТА проводит зондирование фундаментальной способности, которая лежит в основе более совершенных форм пространственного понимания по аналогии с человеком. СПАРТА производит произвольное количество фотореалисов