Компьютерные науки > Машинное обучение [представлено 30 июня 2026 года] Название: Ahabench: Учатся ли агенты из предыдущего опыта? Предполагается, что агенты на различных языках будут работать в течение длительных периодов времени: они задают последующие вопросы, повторно используют примеры, обрабатывают отзывы с помощью инструментов и адаптируются к отсроченным последствиям. Большинство оценок по-прежнему перенастраивают агент после быстрого завершения или оценки только окончательного состояния одной траектории. AhaBench задает более оперативный вопрос: когда фиксированная модель получает полезный опыт, улучшается ли ее последующее поведение при соответствующем условии оценки, в котором очевидная поддержка была удалена, изменена или отложена? Номер состоит из трех компонентов. Aha-Puzzle тестирует бесхинные исследования после решения загадок скрытого состояния; Aha-Euler превращает математические идеи в сфабрикованные, как проект-Эулер, задания, которые были подготовлены/придержаны с точными действительными; и Aga-Ving - внедрение с открытым исходным кодом под вдохновением Vinging-Bench - проверка того, остается ли имитируемый торговый агент прибыльным при рассмотрении задержек с обратной связью и оперативных инцидентов. Ahabench сообщает о трехкомпонентной системе оценки: первоначальные базовые показатели, начинающие компетентность; основные показатели после проведения исследований; более поздние эмпирические результаты; и " Учебный лифт &" - это их разница. Это…
Ахабенч: Учатся ли агенты из предыдущего опыта? Контрольный параметр для непрерывного обучения в течение длительного периода времени
arXiv: 2609.05435v1 Annuaire Type: New Humber Abstract: Предполагается, что современные языковые агенты будут работать в течение длительных периодов времени: они задают последующие вопросы, повторно используют подготовленные примеры, обрабатывают обратную связь с инструментами и адаптируются к отсроченным последствиям. Большинство оценок по-прежнему перенастраивают агент после быстрого завершения или оценки только окончательного состояния одной траектории. AhaBench задает более оперативный вопрос: когда фиксированная модель получает полезный опыт, улучшается ли ее последующее поведение при соответствующем условии оценки, в котором очевидная поддержка была удалена, изменена или отложена? Номер состоит из трех компонентов. Aha-Puzzle тестирует бесхинные исследования после решения загадок скрытого состояния; Aha-Euler превращает математические идеи в сфабрикованные, как проект-Эулер, задания, которые были подготовлены/придержаны с точными действительными; и Aga-Ving - внедрение с открытым исходным кодом под вдохновением Vinging-Bench - проверка того, остается ли имитируемый торговый агент прибыльным при рассмотрении задержек с обратной связью и оперативных инцидентов. Ahabench сообщает о трехразовом счёте