Подталкивание к самоконтролю в мультимодальных средствах, позволяющих повысить эффективность обучения

#Подталкивание #Annuales #Type #Habstratement #Russian

arXiv: 2609.08025v1 Annuales Type: New Habstratement: Russian Agencies все чаще полагаются на внешние инструменты, такие как поиск в Интернете для ответа на сложные запросы. Совершенствование алгоритмов усовершенствования обучения (RL), таких, как GPO, позволило улучшить долгоформатное мышление в моделях только текстового языка, особенно для кодирования и математики. Однако надежное использование инструментов в мультимодальных агентах по-прежнему сопряжено с трудностями, поскольку модели должны интерпретировать текст и изображения при одновременном учете шумных полученных доказательств, зачастую под ограниченным контролем на уровне конечных результатов без четких проверочных сигналов. Мы представляем систему самоконтроля с помощью усовершенствования обучения (SVRL), которая представляет собой только систему корректировки RL, позволяющую обучать мультимодальных агентов проверке и фильтрации собранных доказательств в рамках их собственных рассуждений, что снижает зависимость от внешних контролеров на момент вывода. SVRL также вводит наказание, которое позволяет избежать ненужных звонков с помощью инструментов и вознаграждение за разнообразие запросов, стимулирующее различные, хорошо составленные запросы на поиск, обеспечивая тонкий g