Реклама

RL-ARC: Калибровка крупных расчетных моделей с помощью обоснованной неопределенности

#RL-ARC #Калибровка #Укрепляемое #РЛВР #РВПЗ

arXiv: 2610.11352v1 Тип уведомления: новое резюме: языковые модели (ОДМ) обычно обучаются с помощью программы " Укрепляемое обучение с поддающимися проверке ревардами (РЛВР), чтобы повысить их способность к аргументации. Однако, поскольку в РВПЗ не учитывается конкретная калибровка во время обучения, она может привести к резкому разложению калибровки, включая чрезмерную уверенность. Последние методы подготовки специалистов по калибровке для ММ, которые включают в себя цели оценки неопределенности при подготовке кадров, улучшают калибровку, но все еще демонстрируют чрезмерную уверенность в процессе перераспределения, одновременно жертвуя результатами анализа. С этой целью мы предлагаем RL-ARC, систему подготовки по калибровке, которая совместно использует аргументированную уверенность и отвечает на вопросы доверия. В частности, RL-ARC использует аргументацию доверия в качестве дополнительного сигнала для калибровки достоверности ответов, используя ее как корректируемый с учетом доводов и правил при правильном рассмотрении дел и как наказание за чрезмерное доверие к неверным делам. Всесторонние результаты в рамках системы идентификации и определения