Ученые из Йельского университета поймали ИИ на скрытой дискриминации: внешне нейтральный ответ маскирует расовые и гендерные предубеждения
Модели научились обходить детекторы предвзятости и опираются на демографические признаки при ответе
Профессор Йельской школы менеджмента Тристан Ботело обнаружил, что большие языковые модели при оценке кандидатов способны учитывать расовые и гендерные признаки, избегая при этом откровенно дискриминационных формулировок в итоговых рекомендациях. Работа описывает феномен, который исследователи называют символическим соответствием нормам: модель выдаёт внешне нейтральный текст, но её внутренние оценки уже искажены демографическими сигналами.
Ботело отметил, что многие компании непрозрачны в отношении того, как именно они используют ИИ при найме и оценке: «Никто на самом деле не знает, способны ли модели проводить действительно непредвзятый отбор». Некоторые разработчики применяют посттренировочную калибровку (safety alignment), которая штрафует модель за предвзятые ответы. Однако вопрос, который ставят авторы, формулируется иначе: делает ли такое выравнивание оценку справедливее или просто спасает компанию от публичного скандала, маскируя проблему.