Изучение различных преференций

#Изучение #Annualce #Type #Учеба #Существующие

arXiv:2609.17847v1 Annualce Type: cross rebstrate: Учеба на основе обратной связи с людьми стала центральной парадигмой для подготовки современных систем АИ, где модели человеческой полезности используются в качестве моделей поощрения при обучении политике. Существующие методы, как правило, принимают на себя функцию "мах" (универсальная полезность), охватывающую все население, и рассматривают разногласия между аннулаторами в качестве стохастических отклонений. Хотя это предположение подходит для объективных задач, оно разбито в субъективных областях, где предпочтения систематически различаются между отдельными лицами. Мы изучаем проблему субъективного обучения предпочтениям, при котором наблюдаемый выбор вытекает из неоднородных, но внутренне последовательных функций полезности. Основываясь на теории рационального выбора, RCT \parencite {tversky1981framing}, мы введём функции mph [неограниченное значение], обусловленные как индивидуальными условиями, так и их контекстом принятия решений, и предлагаем новую многоэтапную архитектуру для оценки их с помощью мультимодальных данных. Мы оцениваем наши рамки в отношении недавно собранного d

Компьютерная наука > Искусственный интеллект [представлен 15 сентября 2026 года] Название: " Учеба в области гетрогеничных преференций, Вид PDF HTML (экспериментальный) Резюме: Обучение на основе обратной связи с людьми стало центральной парадигмой для подготовки современных систем АИ, где модели человеческой полезности используются в качестве моделей вознаграждения при обучении политике. Существующие методы, как правило, принимают на себя функцию "мах" (универсальная полезность), охватывающую все население, и рассматривают разногласия между аннулаторами в качестве стохастических отклонений. Хотя это предположение подходит для объективных задач, оно разбито в субъективных областях, где предпочтения систематически различаются между отдельными лицами. Мы изучаем проблему субъективного обучения предпочтениям, при котором наблюдаемый выбор вытекает из неоднородных, но внутренне последовательных функций полезности. Основываясь на теории рационального выбора, RCT \parencite {tversky1981framing}, мы введём функции mph [неограниченное значение], обусловленные как индивидуальными условиями, так и их контекстом принятия решений, и предлагаем новую многоэтапную архитектуру для оценки их с помощью мультимодальных данных. Мы оцениваем наши рамки на недавно собранном наборе данных в размере более 575 долл. Наши эксперименты показывают, что индивированные модели полезности значительно превосходят универсальные модели полезности, включая базовые исходные параметры. Наши результаты…