Социальная интуиция против Машинное обоснование: прогнозирование взаимодействия между человеком и роботом из различных форм
arXiv: 2609.073994v1 Annuate Type: New Humber Briefing: Убедить, что человек будет взаимодействовать с собственной точки зрения - это очень интуитивная задача для людей, которая опирается на комбинацию сигналов. Мы исследуем, как люди действуют при прогнозировании намерения человека взаимодействовать с точки зрения сервисного робота, используя только позы или полные видео-вводы, а затем сопоставляем различные модели на основе легкой массы поз и современные модели языка зрения. Мы провели проверку набора данных HUI360 на фиксированном экспериментальном подклассе из 100 испытательных треков (25 положительных, 75 отрицательных). Мы обнаружили, что с помощью только позовых входных данных антекторы человека превосходят модели легкого веса, но не на больших окраинах (+0,08 в F1-Score). Но если дать полный эгоцентрический видеоролик с мишенью, то человеческие аннотаторы работают значительно лучше и в значительной степени превосходят модели Видения-Лангуажа (+0.2 в F1-Score). Мы также сравнивали VLM различных размеров и в разных условиях ввода, и обнаружили, что лучший рез.