Контрольные параметры крупных языковых моделей для извлечения биомедицинских данных о связи
arXiv: 2609.19071v1 Annuales Type: New Extraview: Извлечение ассоциаций SNP-phenoтипов из биомедицинской литературы имеет жизненно важное значение, но сопряжено с трудностями. Мы провели сравнительный анализ различных моделей НЛП, включая MLM, гибридную архитектуру и самые современные МЛМ (Gemini 2.0, OpenAI O-серии, Qwen, Mistral), на основе SNPFhenA corpus по трем направлениям: уровень предложения, абстрактный уровень и классификация прочности ассоциации. OpenAI O1 добилась результатов в области современного развития (SOTA) с использованием малоразборного обучения для классификации неусовершенствованных предложений (F1 0,89) и создала новую SOSA для абстрактной классификации уровней ( F1 0,82). Классификация прочности ассоциации оказалась трудной, хотя усовершенствованная система Gemini 2.0 Pro в ходе первой оценки LLM для этой задачи была наиболее эффективной (F1 0.60). Проприетарные МЛМ, особенно в конфигурациях с небольшим числом выстрелов (O1) или усовершенствованных (Gemini 2.0 Pro), значительно превышают другие модели. Эти результаты подтверждают способность современных ММЗ для получения геномных знаний.