Реклама

Когда агенты должны думать? Адаптивное обоснование на основе перекрестной оценки

#Когда #Адаптивное #Annuales #Type #Habstrate

arXiv: 2610.12061v1 Annuales Type: New Habstrate: Major Lange Model (LLM) продемонстрировали большой потенциал в решении сложных задач. Они обычно проводят аргументацию перед каждым действием на протяжении всей траектории взаимодействия. Однако на каждом этапе, возможно, нет необходимости в рассуждениях, поскольку приведенные ранее доводы могут и далее поддерживать последующие действия. Поэтому главная задача заключается в том, чтобы определить, когда имеющиеся доводы остаются достаточными и когда необходим новый логичный шаг без использования дорогостоящей проверки на основе поколения. Мы считаем, что снижение вероятности последующих справочных действий после того, как будут удалены дополнительные аргументы, тщательно проследив за тем, остаются ли эти действия подлежащими возмещению с учетом более ранних доводов, является эффективным и легким сигналом для оценки поддержки перекрестковых действий. Исходя из этого наблюдения, мы предлагаем провести оценку адаптации на основе перекрестной оценки (RACE) в качестве учебного подхода к рассуждению о адаптивных агентах. RACE вводит симпатию G