Компьютерная наука > Машинное обучение [представлено 15 сентября 2026 года] Название: Легко поймать лжеца, трудно очистить честного: Языковые модели диагностирования коррумпированного репарационного канала из проверенного просмотра записи PDF HTML (экспериментального) резюме: агенту, который учится награде, нужно доверять тому, что сообщает об этих вознаграждениях. Когда отчеты внезапно меняются, либо мир изменился или репортер сломался. Из одних лишь докладов они неразличимы, и теория дополнительного обучения показывает, что их отделяет никакое дополнительное количество опыта. Предписываемый побег является более обширной информацией о самом репортере. Мы спрашиваем, использует ли модель замороженного языка, вручаемая именно эти данные. Мы строим двухвариантную игру, в которой обмен и лживый репортер создадут байт-идентическую историю. Затем мы добавляем один проверенный рекорд: независимый контроль реального результата одного раунда, напечатанный в дополнение к тому что репортер сказал об этом раунде. Эта единственная линия решает дело. Мы просим трех крупных моделей из двух семей ответить на один вопрос одним письмом. Репортер честный или лжец? Они почти идеально ловят лживого репортера. В классе 70B, который содержит в каждом состоянии, которое мы пробовали; модель 32В попадает в одну формулировку. Они гораздо реже очищают честного репортера и как часто зависят от того, что не должно иметь значения. Средние по количеству раундов, писем и формулировок модель 72B называет…
Легко поймать лгуна, трудно очистить честного: языковые модели с искаженным каналом возмещения из проверенной записи
arXiv: 26009.17226v1 Annuate Type: New Habstract: Агент, который учится на наградах, должен доверять любому сообщению об этих вознаграждениях. Когда отчеты внезапно меняются, либо мир изменился или репортер сломался. Из одних лишь докладов они неразличимы, и теория дополнительного обучения показывает, что их отделяет никакое дополнительное количество опыта. Предписываемый побег является более обширной информацией о самом репортере. Мы спрашиваем, использует ли модель замороженного языка, вручаемая именно эти данные. Мы строим двухвариантную игру, в которой обмен и лживый репортер создадут байт-идентическую историю. Затем мы добавляем один проверенный рекорд: независимый контроль реального результата одного раунда, напечатанный в дополнение к тому что репортер сказал об этом раунде. Эта единственная линия решает дело. Мы просим трех крупных моделей из двух семей ответить на один вопрос одним письмом. Репортер честный или лжец? Они почти идеально ловят лживого репортера. В классе 70B, который содержит в каждом состоянии, которое мы пробовали; 32В