Адаптация Evo: адаптационное обучение агентов с изменяющимся надзором
arXiv: 2610.11354v1 Тип уведомления: новое резюме: Поставленные в соответствии с правилами контекстуальные задачи решения требуют моделей применения конкретных правил к конкретному контексту и доказательствам. Письменные правила могут оставлять пробелы в руководящих указаниях по принятию решений и оценке процесса, а справочные решения отличаются от правил и доказательств. Для решения этих проблем мы внедряем AdventionEvo, основу для обучения под ненадежным надзором в целях оптимизации политики укрепления доверия пар с развитием знаний о принятии решений и программ оценки. В ее учебном модуле используется система GRPO (CA-GRPo) для обеспечения сбалансированности результатов и вознаграждения за процесс в соответствии с базовой степенью доверия. Его модуль " Эволюция &qt; обобщает знания о принятии решений, полученные в результате повторяющихся неудач во всех случаях обучения, и уточняет рубрики процессов для выявления упущенных ошибок. В поддержку эмпирической оценки мы составляем набор данных о умеренном содержании промышленных смешанных перевозок, включающий комплекты учебных материалов и наборы для проведения испытаний в режиме period и внепериодного цикла (wi)