Остаточное преимущество: консультирование учащихся-ученых по вопросам образования с поддающейся проверке компенсацией
arXiv: 261 0.111519v 1 Annuation Type: New Humber: Supporting Upduction with поддающееся проверке вознаграждение (RLVR) и OPD стали двумя основными парадигмами для моделей рассуждений после прохождения подготовки. RLVR дает каждому ответу единый знак результата, оставляя ступенек внутри него без отдельной оценки. ОДП обеспечивает руководство на уровне символов в префиксах для учащихся, но его ориентационный сигнал не отражает напрямую структуру учителя - студенческие разногласия по всему словарю. Глупый, неограниченный контроль за log-Ratio может усилить влияние учителя, но сильный решающий вопрос необязательно является подходящим руководством, когда путь ученика отходит от пути учителя. Мы предлагаем остаточное преимущество (\RA {}), которое рассматривает учитель-остаток вероятности учащихся как ограниченное одноэтапное вознаграждение, вычитает соответствующее государственное значение в рамках студенческой политики для формирования стандартного преимущества и центрирует результат в каждом ответе до добавления его к преимуществу проверяющего. Руководство t