Материал подготовлен в рамках курса «Машинное обучение. Экспертный уровень».
Привет, Хабр!
Обучили классификатор, он выдаёт predict_proba, вы берёте эти числа как вероятности и строите на них логику: если модель уверена больше чем на 0.8 — принимаем автоматически, меньше — отправляем человеку. Порог 0.8 выбран как «модель права в 80% случаев».
Вот только модель, скорее всего, права совсем не в 80% случаев на этом пороге. Число 0.8 на выходе классификатора — это не вероятность в обычном смысле, а внутренний скор, который модель выдала, оптимизируя свою функцию потерь. Он неплохо ранжирует объекты — те, кому модель дала выше, обычно правее тех, кому ниже. Но как абсолютная вероятность он врёт, иногда сильно.