Адаптивная взаимная дистилляция для сбалансированной многоцелевой подготовки моделей крупных языков
arXiv: 2610,02856v1 Тип уведомления: новое резюме: многоцелевое обучение в рамках крупных языковых моделей (МЛМ) направлено на повышение эффективности работы по выполнению различных задач при неравном объеме данных о профессиональной подготовке. В рамках существующих методов основное внимание уделяется сбалансированному участию в решении задач в ходе подготовки кадров с использованием одной модели. Различные стратегии сбалансированного распределения задач могут создавать модели с взаимодополняющими преимуществами, создавая возможности для взаимной перегонки. Вместе с тем полезность межмодельного надзора может варьироваться в зависимости от задач, направлений передачи и этапов подготовки. Мы предлагаем адаптивную взаимную дистилляцию (АМД) - совместную программу после профессиональной подготовки, в рамках которой совместно обучаются две модели с различными стратегиями распределения задач. АМД оценивает возможные корректировки дистилляционных весов с помощью коротких учебных зондов, совместно используемых в рамках различных задач, а затем использует результаты проверки по конкретным задачам для выбора корректировки каждой задачи и направления передачи. В рамках шести контрольных показателей и трех основных элементов системы УЗМ обе модели AMD достигают более высоких средних базовых значений s