Представьте себе оценку системы поиска-повышения поколения. Пользователь задает вопрос, система получает текстовый отрывок и судья LLM решает, относится ли он к делу. Чтобы уменьшить шум, вы просите несколько моделей оценить один и тот же ход. Восемь - "относительно"; два - "не относится". Восемь из десяти чувствуют себя убедительно. Но важный вопрос заключается не только в том, сколько судей согласились с этим соглашением, но и как они независимо пришли к этому соглашению. Если восемь согласованных судей действительно являются различными источниками доказательств, то соглашение является мощным сигналом. Но если у них есть оперативные шаблоны, тренировочная линия, модель семьи или общее слепое пятно, они могут повторять ту же ошибку. По подсчету голосов улики выглядят сильнее, чем на самом деле. Наша работа : Aгрегация ярлыков, подлежащих контролю в качестве судьи LLM с помощью моделей Ising, была соавтором Shiva Kasiviswanathan и представлена на Международной конференции по машинному обучению (ICML) в этом году. Мы представляем метод оценки корреляции между результатами работы судей и соответствующей корректировки совокупного показателя для обеспечения разнообразия мнений. В тестах на три различные задачи наш метод превзошел наилучшую исходную точку — коллегию судей, взвешенных по исторической точности, — на 9-14% от стандартных показателей. Скрытые предположения Притягательность большинства голосов - это простота. Каждый судья получает один голос, и ответ с большим…
Когда судьи ЛЛМ согласятся, должны ли мы им верить?
Статья URL: https://www.amazon.science/blog/when-lm-decents-agree- we-ferie-them Reservations URlect: http s://news.ycombinator.com/item?id=49699590 Пункты: 4 # Комментарии: 0