Чанк Дважды, Эмбед один раз: систематическое исследование сегментации и представительских компромиссов в химическом-показательном поколении
arXiv: 25006.17277v2 Тип уведомления: заменить перекрестное резюме: Этап поиска генератора с добавлением (RAG) для ответов на научные вопросы зависит от того, как сегментируются документы и каким образом куски представлены в месте размещения. Эта зависимость особенно актуальна для текстов по химии, которые содержат плотную терминологию, символическую нотировку, количественные данные и контекст, связанные со структурой документов. Вместе с тем для получения данных по химии по-прежнему мало что говорит о взаимосвязи между стратегией " хитрости и встроенной моделью. Используя HemQuests, набор из 952 пар ответов на вопросы из 151 ChemRxiv в 17 химических подполе, мы составляем целевые показатели для контролируемой оценки на уровне кусков, Massive Text Embeding Baseor (MTEB). Мы сначала снимем 41 модель, встраивающую внешние химические индикаторы ChemNQ Retrieval и ChemHotpotQARetrieval с помощью геометрической-миановой метрики на 10 месте (Geom@10), которую мы вали