Как после обучения на суррогате: выборка стержня смягчает взлом вознаграждения
arXiv:2610.11281v1 Annuate Type: Cross Brieft: Большие языковые модели (LMS) обычно проходят подготовку после судей ЛММ и других дешевых суррогатных работников, поскольку настоящее вознаграждение, например человеческое предпочтение, слишком дорого для того, чтобы задавать вопросы по шкале. Такая практика часто приводит к взлому, когда повышение уровня обучения от неправильной калибровки суррогатной матери ведет к нежелательным побочным эффектам. В этой работе мы изучаем условия, в которых небольшое количество долларов США от образцовых результатов аннотируются с наземной этикеток (например, по результатам экспертного обзора) и используются для перекалибровки судьи ЛУЗР до оптимизации против нее. Предшествующие подходы к оценке перекалибрования являются дорогостоящими или эвристическими, и известно, что отбор проб на уровне политики не проходит в тех случаях, когда суррогатная система неправильно калибруется по редким результатам. В этой работе мы предлагаем взять выборку с помощью конвертов, теоретически обоснованный метод повторной калибровки судьи, который призван свести к минимуму верхнюю границу от сожаления по поводу модели после подготовки при том предположении, что вознаграждение и перекалибр человека