Реклама

УатуоГПТ-3: Адаптация только области с использованием базовых моделей

#УатуоГПТ #Адаптация #Annualce #Type #Brieftre

arXiv: 2610,05966v 1 Annualce Type: New Brieftre: Domain advention имеет целью превратить модель языка общего назначения (LLM) в эксперта по целевому домену. Хотя доминирующий трубопровод SFT+RL обеспечивает удобный холодный старт, он может уменьшить разнообразие разведочных работ и создать дополнительную сложность за счет многоэтапной оптимизации. Эти ограничения стимулируют адаптацию только RL. Вместе с тем, чисто политика RL страдает от проблемы " холодного старта &qt; , в то время как смешанная политика RR все еще не дает результатов: на ранних этапах обучения в рамках подготовки преподавателей слишком медленно усвоены информационные знаки, а запутанная деятельность учителей может помешать дальнейшему улучшению положения. Мы идентифицируем эти два режима отказа как Гродиент Голодство и Учитель-Распространение Анхоринг. Для их решения мы предлагаем оптимизацию политики на одном этапе (ОДП), которая рассматривает результаты работы преподавателей в качестве временного руководства по совершенствованию политики. OnePO сочетает адаптационную объективную эволюцию в целях укрепления обучения на информационных табличках с низкой вероятностью для учителей и на диске