Оценка методов руководства с использованием человеческого сходства

#Оценка #Текущие #Большой #Используя

arXiv:2505.19333v2 Тип уведомления: заменить резюме: Текущие оценки методов управления Большой языковой моделью (LLM) сосредоточены на конкретных показателях работы, не обращая внимания на то, насколько хорошо управляемые представления согласуются с человеческим сознанием. Используя хорошо установившуюся задачу по триединому сходству, мы оценили управляемую МЛМ на их способность гибко оценивать схожесть между концепциями, основанными на размерах или видах, двумя центральными измерениями, организовывающими ментальные представления человека. Мы обнаружили, что оперативные методы рулевого управления опережают другие методы как с точки зрения точности поворота рулевого колеса, так и в плане соответствия модели человеку. Мы также обнаружили, что МЛМ были предвзяты к сходству «типового» и боролись за «размерное» согласование. Такой подход к оценке, основанный на принципах человеческого самосознания, способствует дальнейшему повышению эффективности оперативного рулевого управления и позволяет выявить привилегированные репрезентативные оси в МЛМ перед началом поворота.