Компьютерные науки > Машинное обучение [представлено 7 сентября 2026 года] Название: Efficient Exploration Is Unofect PDF HTML (экспериментальное) Резюме: Эта работа предлагает альтернативный взгляд на эффективное исследование и изучает его теоретические и эмпирические последствия в отсутствие внешних выгод. В частности, мы называем эффективных исследователей в качестве агентов, которые придают приоритетное значение накоплению широкого опыта, т.е. данных, подкрепляющих модели обучения, способные прогнозировать и адаптировать окружающую среду. Это позволяет нам анализировать эффективность исследований сквозь призму прогнозирования и обобщения. Теоретически мы показываем, что оптимально эффективные исследователи естественно планируют свои траектории для посещения в первую очередь наиболее информативных и обучаемых регионов. Эмпирически мы показываем, что оптимизация для этих агентов приводит к автоматической учебной программе все более сложных моделей поведения даже в относительно простых условиях. Эти результаты свидетельствуют о том, что одной лишь реализации этой сугубо присущей цели достаточно для того, чтобы вызвать появление очень изощренных моделей поведения. Мы считаем, что эти новые рамки обеспечивают принципиальный механизм, с помощью которого системы " агент-окружающая среда" могут поддерживать открытый процесс все более сложного поведения без внешних наград, задач или целей. Загрузка ссылок и цитат... Библиографические и цитационно-инструментальные средства…
Достаточно эффективного исследования
arXiv:2609.075775v1 Сообщение типа: новое резюме: В этой работе предлагается альтернативный подход к эффективной разведке и анализируются ее теоретические и эмпирические последствия в отсутствие внешних выгод. В частности, мы называем эффективных исследователей в качестве агентов, которые придают приоритетное значение накоплению широкого опыта, т.е. данных, подкрепляющих модели обучения, способные прогнозировать и адаптировать окружающую среду. Это позволяет нам анализировать эффективность исследований сквозь призму прогнозирования и обобщения. Теоретически мы показываем, что оптимально эффективные исследователи естественно планируют свои траектории для посещения в первую очередь наиболее информативных и обучаемых регионов. Эмпирически мы показываем, что оптимизация для этих агентов приводит к автоматической учебной программе все более сложных моделей поведения даже в относительно простых условиях. Эти результаты свидетельствуют о том, что одной лишь реализации этой сугубо присущей цели достаточно для того, чтобы вызвать появление очень изощренных моделей поведения. Мы верим