Реклама

Игра дистилляции: адаптивные оценки и эффективная защита

#Игра #Annuate #Type #Наша #Например

arXiv: 2605.22737v4 Annuate Type: заменить перекрестное резюме: дистилляционные атаки создают компромисс для разработчиков моделей: те же результаты, которые делают модель более полезной, также могут облегчить ее подмножество. Мы изучаем этот компромисс с помощью мини-максимумной игры между учителем и адаптивным учеником. Наша рамочная основа дает вращающиеся односторонние правила реагирования: адаптивное правило оценки, в котором студент перевешивает ценные примеры, и шаблон защиты со стороны учителя, который подавляет результаты наиболее полезных для дистилляции. Например, из дешевого опосредованного показателя мы получаем продукт экспертов (POE), простую защиту только для форварда, которая сочетает учителя с опосредованной студенткой в течение поколения. Эмпирически адаптивная оценка выявила большой пробел в пассивной адаптации: что касается современной обороны, то адаптируемые учащиеся восстанавливают значительно больше возможностей, чем это предполагает пассивная оценка GSM8K и MTH. В рамках этой более эффективной оценки очевидное расхождение в надежности, по всей вероятности, будет иметь место.