SkillLift: Учеба в стиле Sense Rubricks из Sparse Oracles for Effective Skell Evolution

#SkillLift #Учеба #Sense #Rubricks #Sparse

arXiv: 2609.15396v1 Annuales Type: New Habstrate: LLM-агенты все больше полагаются на постоянные навыки, т.е. повторно используемые процедурные стимулы для адаптации без обновления веса. Существующие методы самореволюции навыков непосредственно пересматривают текст на основе отзывов об исполнении, но для каждой оценки оракул требуется полное развертывание агента, создавая узкий пункт контроля, который ограничивает поиск обновления данных с ошибками. Наша главная точка зрения заключается в том, что ранжирование является более плавной целью контроля, чем абсолютная регрессия результатов: определение того, какие навыки лучше всего требуют меньшего количества оценок оракул по сравнению с прогнозом точных показателей. Основываясь на этом понимании, мы предлагаем SkillLift, который отделяет поиск навыков от стоимости оракула путем изучения оркестра в качестве структурированного пространства для оценки. Мы официально оформим это как двууровневую проблему оптимизации, решённую путем чередования: внутренняя цепь использует замерзшую надпись в качестве дешевого суррогата для управления пересмотром навыков без издержек оракула, а внешняя петля призывает небольшой num.

Компьютерные науки > Искусственный интеллект [представлен 14 сентября 2026 года] Название: SkillLift: Stearing Dense Rubricks из Sparse Oracles for Effectied Skell Evolution View Astractive: LLM-агенты все больше полагаются на постоянные навыки, т.е. повторно используемые процедурные стимулы для адаптации без обновления веса. Существующие методы самореволюции навыков непосредственно пересматривают текст на основе отзывов об исполнении, но для каждой оценки оракул требуется полное развертывание агента, создавая узкий пункт контроля, который ограничивает поиск обновления данных с ошибками. Наша главная точка зрения заключается в том, что ранжирование является более плавной целью контроля, чем абсолютная регрессия результатов: определение того, какие навыки лучше всего требуют меньшего количества оценок оракул по сравнению с прогнозом точных показателей. Основываясь на этом понимании, мы предлагаем SkillLift, который отделяет поиск навыков от стоимости оракула путем изучения оркестра в качестве структурированного пространства для оценки. Мы официально оформим это как двууровневую проблему оптимизации, решённую путем чередования: внутренняя цепь использует замороженный текст в качестве дешевой суррогатной строки для управления пересмотром навыков без издержек оракула, а внешняя петля призывает небольшое число разворотов оракул для перевязки рубрики через корреляцию рейтинга, амортизацию стоимости оракла и стабилизацию обновления текстового пространства. Эксперименты по…