Решение вопросов, имеющих важное значение: система обучения на двух уровнях в целях обеспечения визуального мультимодального рассудка

#Решение #Annualte #Type #Humber #Abstract

arXiv: 2609.18057v1 Annualte Type: New Humber Abstract: Supportment Upducation with поддающееся проверке вознаграждение (RLVR) значительно улучшило умения в плане рассуждений моделей с большим видением. Однако стандартные алгоритмы RLVR в политике сталкиваются с критическим пробелом в области оптимизации при сохранении и укреплении визуально обоснованных рассуждений: ценные теоретически обоснованные траектории рассуждения выбрасываются после единого обновления, а единообразное распределение символических преимуществ не позволяет модели укрепить критические представления или логические шаги. Для устранения этого пробела мы предлагаем создать систему обучения на двух уровнях, которая будет обеспечивать оптимизацию политики с помощью информативных визуальных рассуждений. В частности, PIVOT вводит самокалиберированный механизм перепроигрывания опыта, который выборочно собирает и воспроизводит визуальный исторический опыт в качестве стабильных опор для оптимизации политики. Опираясь на это, мы далее разрабатываем механизм распределения преимуществ с учетом перспективы