Стабильно-MM-R1: Анхоринг мультимодальных динамических рассчитывающих процессов с помощью стратификации, регулируемой энтропией

#Стабильно-MM #Анхоринг #Annualce #Type #Humber

arXiv: 2609.071484v1 Annualce Type: New Humber Abstract: В то время как укрепление обучения (RL) эффективно стимулирует аргументацию в крупных языковых моделях, нынешние трубопроводы сдерживаются нестабильностью подготовки и быстрым крахом энтропии. Эти ограничения часто обусловлены "заглушением сигналов, подаваемых в режиме градиента", и низкокачественными сигналами при стандартных процедурах отбора проб. В этой работе мы предлагаем надежную, ориентированную на конкретные данные основу для стабилизации профессиональной подготовки в области RL. Сначала мы введем био-программную добычу данных (PAQM), которая фильтрует данные динамическо, чтобы сосредоточиться на "зоне дистилляции" - образцах с высоким потенциалом для выявления потенциала. Кроме того, мы представляем Hybrid Streatized Replay (HSR) — новый механизм реструктуризации партий путем стратификации развертываемых программ на основе Path Entropy, доверительного опосредованного уровня развертывания и вознаграждения за результаты. В рамках каждого этапа оптимизации HSR повторно использует текущие политические «стабильные якоря» и «Hard Notes», чтобы создать высококонтраст-группы оптимизации, а затем очистить свои буфера до следующего st.