От намерения к действию: контроль за безопасностью LLM при выдаче разрешения на использование автоответчика
arXiv: 2609.19630v1 Тип уведомления: новое резюме: крупные языковые модели (МЛМ) все чаще включаются в состав автоответчиков. Но увязка естественных языковых запросов с функциями транспортных средств создает проблему, связанную с разрешением на безопасность. Прежде чем выполнять команду, система должна выбрать: выполнить, отказаться, уточнить, потребовать подтверждения, отложить ручное управление, вызвать аварийный ответ или не звонить с помощью инструмента. Насколько нам известно, предварительные оценки не изолируют это решение до принятия решения по каждому оратору, статус удостоверения подлинности, состояние транспортного средства и наличие инструментов. Мы введем 202-сценарийский эталонный показатель с справочными решениями по семиклассной таксономии. Мы оцениваем две местные модели с открытым весом и три МЛМ на основе АПИ, используя показатели согласования решений и конкретные погрешности в плане безопасности. Согласование варьируется от 40,1% для ламы 3.2 3В до 89,1% для Гемини 3.1 Прообследование. По данным моделей, основанных на АПИ, их доля составляет от 83,2% до 89,1% без каких-либо статистически значимых различий между ними.