Проблемы аудита: изменчивость результатов крупных языковых моделей здравоохранения
arXiv: 2609.16590v1 Annualce Type: New Humber Abstract: People все чаще используют модели приграничной АИ для консультирования по вопросам здоровья, но с использованием различных способов доступа (например, ChatGPT, CATGPHHed, API) с различными условиями. Здесь мы находим систематические различия в режимах доступа. Поскольку оценки обычно основываются на АПИ, в то время как потребители взаимодействуют через интерфейсы чатботов, эти расхождения ограничивают достоверность оценок. Наши выводы подчеркивают настоятельную необходимость того, чтобы поставщики моделей могли добросовестно копировать опыт потребителей и создавать условия для проведения тщательных проверок.