Обвиняемый Лонгбенч: выявление разрыва между доказательствами и ЭПЧ в продольном процессе принятия решений по вопросам ЭПЧ

#Обвиняемый #Лонгбенч #Annualce #Type #Humber

arXiv:2609.076061v1 Annualce Type: New Humber Abstract: Применение крупных языковых моделей (LMS) к персональным медицинским помощникам привлекает все больший интерес. Вместе с тем существующие медицинские показатели в значительной степени основаны на статических ответах на заранее отобранные данные, оставляя неясным вопрос о том, могут ли МЛМ принимать надежные клинические решения из реальных продольных электронных медицинских записей (ЭПЧ). Для преодоления этого пробела мы введем систему ObGynLongBench, основанная на правилах и давнишний стандарт ЭПЧ для принятия решений по акушерству и гинекологии, которая включает 1500 клинических решений из 976 реальных беременностей и правил отслеживания. Каждый случай привязан к пациенту, пункту времени беременности и предрешенному сроку информации, что позволяет проводить оценку ЭПЧ на уровне только доказательств, уровня посещений и истории. Оценка 17 МРМ свидетельствует о наличии значительного разрыва между данными и ЭПЧ: модели работают хорошо, когда данные представляются непосредственно, однако точность снижается в тех случаях, когда доказательства должны быть получены из того же дня