YFPO: Оптимизация примесей с помощью нейронных наград
arXiv:2605.11906v2 Annuales Type: заменить резюме: оптимизация привязки стала широко используемой парадигмой после обучения для улучшения умения мыслить больших языковых моделей. Существующие методы обычно извлекают уроки из предпочтительных и отверженных ответов как внешнего поведенческого надзора, при этом в значительной степени игнорируются связанные с возможностями сигналы, закодированные во внутреннем представлении модели. В этой работе мы изучаем вопрос о том, могут ли такие внутренние сигналы служить полезным вспомогательным надзором для математического обоснования. Мы внедряем YFPO (Yoked Feature Preparative Оптимизация), систему оптимизации преференций с нейронной ориентацией, которая позволяет супружеским парам учиться на уровне реакций на предпочтение с помощью нейронных преимуществ. YFPO сначала использует AttnLRP для идентификации внутренних характеристик, связанных с математикой, а затем получает дополнительное вознаграждение от диапазона активации этих нейронов между предпочтительными и неблагодарными ответами. Эта награда сочетается с целью оптимизации стандартных преференций, что поощряет модель