Дискальное изучение риска и риска: тематическое исследование роботов
arXiv: 2609.079998v1 Annuaire Type: New Humber Abstract: Мы изучаем контроль за процессами принятия решений в Маркове, при котором качество политики оценивается с помощью динамической и последовательной во времени меры риска " Markov &qt; , а не ожидаемой дисконтированной стоимости. Основным препятствием для сочетания таких мер с усилением обучения является то, что картирование рисков переходного периода зависит от ядра переходного процесса нелинейным образом и поэтому невозможно оценить на основе одного наблюдаемого перехода. Мы устраним это препятствие путем использования карт мини-парча переходного риска: картирование применяется к эмпирическому измерению независимых проб в следующем штате, и результат усреднен. Полученные в результате этого карты вновь согласуются. Однако в качестве ожидаемой величины функции, составляющей стоимость следующего состояния в долл. США, она признает беспристрастную оценку с использованием одного образца. Мы встроили это картирование в двойную глубокую Q-сеть, проанализировали два источника погрешности оценки, которые возникают, и получили метод повернуть Q-обучения на риск, применимый к пространствам состояния далеко за пределами t