:: Разработка критериев эффективности выполнения задач для языковых агентов, использующих различные средства
arXiv: 2609.17985v1 Annuaire Type: New Brieflow: AI-агенты обычно оцениваются по тому, выполняют ли они какую-либо задачу. В интерактивной сервисной среде успешный агент может все же помешать пользователям, задавая повторные вопросы, проводя ненужные обыски или избегая пересмотра. Мы введем RideWay, ориентированный на эффективность агенты для аттракционов в условиях государственной системы вызова инструментов, вместе с эффективностью полезности - успешно сглаженный параметр, который позволяет дисконтировать успешные траектории для звонков из избыточного инструмента и поворотов в направлении пользователя по отношению к конкретным задачам. Парные человеческие предпочтения калибруют относительные штрафы, отражающие совокупный компромисс между объемом работы по оказанию услуг: дополнительный диалог часто создает видимые трения, в то время как дополнительное использование инструментов может иногда проверять ограничения или сохранять намерение пользователей. В 58 задачах и 24 моделях установлен штраф за излишки в два раза больше, чем за избыток инструментов. В случае несогласованных между задачами преференций эффективность