Реклама

Почему дистилляция на уровне политики иногда оказывается неудачной: устранение сигналов об обучении

#Почему #Annualce #Type #Humber #On-Policy

arXiv: 261.10.11247v1 Annualce Type: New Humber: On-Policy Distillation (ODC) позволяет эффективно передавать возможности между языковыми моделями, однако механизмы, лежащие в основе его неудач, не вполне понятны. В рамках генерации кодов и математических рассуждений ОДП с более крупными учителями демонстрирует досрочный уровень потери, при этом среднее окончательное сокращение потерь после 200 обновлений составляет 25,1% по сравнению с 96,2% для преподавателей самоподготовки, полученных в результате дальнейшей подготовки начального учащегося. Чтобы понять эту разницу, мы анализируем ОДП как идеализированную динамическую систему непрерывного времени в пределах малых темпов обучения. Наша диагностика в области профессиональной подготовки связывает эти плато с ранним снижением показателя градиентного сигнала обучения, хотя значительные потери сохраняются; эти измерения не показывают причину ослабления лежащего в основе градиета. Мы также доказываем наличие местных гарантий восстановления для учителей, достаточно близких к первому учащемуся в общей параметризации под регуляцией