Реклама

Когда KL Регулирование пропусков в групповой политике оптимизация

#Когда #Регулирование #Annualce #Type #Brieflow

arXiv:2610.12161v1 Annualce Type: New Brieflow: Почему устранение регуляционной KL-регламентации иногда повышает оптимизацию групповой политики? Это стимулирует изучение вопроса о том, каким образом справочная информация по вопросам политики должна включаться в обновленные данные группового характера. Мы анализируем семь режимов потенциального отказа во взаимодействии между KL и наградами: остаточные обновления KL после вырезки вознаграждения, после отмены градиента и в группах с одинаковым вознаграждением; рост KL при длительности реагирования и дисбалансе в его относительной доле; концентрация KL на небольшом числе знаков; а также выборка шума, когда k1 включается в награду. Мы предлагаем оптимизацию политики нулевого калибрования (ZCPO), которая использует относительный дрейф, измеряемый условной KL для калибровки коэффициентов вознаграждения внутри группы и интегрирования их в суррогатную основу. Математические эксперименты и абляции подтверждают эффективность этого дизайна в наших параметрах.