Компьютерная наука > Расчет и язык [представлен 8 октября 2026 года] Название: Клиникальное использование языковых моделей отличается от того, как модели оцениваются Вид HTML (экспериментальный) Резюме: помощники по большой языковой модели (ЛУЗМ) направляются к врачам в различных системах здравоохранения, а суждения об их готовности основываются главным образом на контрольных оценках, большинство из которых были получены на экзаменационных вопросах или заданных случаях. Контрольный показатель прогнозирует эффективность развертывания лишь в той мере, в какой его имущество напоминает реальное использование, однако редко измерялся тот факт, что контрольные показатели отражают работу, выполняемую этими системами. Здесь мы анализируем 127 833 запроса, направляемые 6 342 врачами, передовыми специалистами и медсестрами 35 специальностей помощнику учреждения в течение восьмимесячного периода. Мы характеризуем каждый запрос с RCQ-Map, подтвержденной клиникой системы на основе таксономии клинических вопросов и оценки LLM, которая регистрирует его задачу, намерения, подотчетность, отсутствие информации и потенциальный вред. На документы и управление (36,2%) и поиск знаний (28,9%) приходится почти две трети использования, а на диагноз - 3,7%; более одной трети запросов не удалось получить ответы как можно лучше. Применение RCQ-Map к 58 государственным контрольным показателям, взятым из основных оценочных номеров и докладов о пограничных моделях, которые мы собираем в Атласе эталонных…
Клиническое использование языковых моделей отличается от методов оценки моделей
arXiv: 261 010.1069v 1 Annualce Type: New Humber Abstract: для врачей всех систем здравоохранения направляются помощники по большой языковой модели (LLM), и суждения об их готовности в основном основываются на контрольных оценках, большинство из которых были получены в результате изучения вопросов или квалифицированных случаев. Контрольный показатель прогнозирует эффективность развертывания лишь в той мере, в какой его имущество напоминает реальное использование, однако редко измерялся тот факт, что контрольные показатели отражают работу, выполняемую этими системами. Здесь мы анализируем 127 833 запроса, направляемые 6 342 врачами, передовыми специалистами и медсестрами 35 специальностей помощнику учреждения в течение восьмимесячного периода. Мы характеризуем каждый запрос с RCQ-Map, подтвержденной клиникой системы на основе таксономии клинических вопросов и оценки LLM, которая регистрирует его задачу, намерения, подотчетность, отсутствие информации и потенциальный вред. На документы и управление (36,2%) и поиск знаний (28,9%) приходится почти две трети использования, а диагноз - 3,7%;