Эдгар Добрибан, статистик из Уортонской школы Пенсильванского университета, сел за разговор с GPT-5.6 Pro. Модели он дал только математическое определение процедуры Бенджамини-Хохберга и вопрос: доказать или опровергнуть. Примерно через полтора часа рассуждений она выдала доказательство, конкретный контрпример и код численного сертификата к нему.
Все это легло в основу препринта, вышедшего 13 июля. Разговор с моделью Добрибан выложил целиком, полный сертификат вынес в приложение, код для воспроизведения — на GitHub. Через три дня появился второй препринт — Лихуа Лея из Стэнфордской школы бизнеса. Он занимался этой же задачей больше пяти лет и не мог ее взять. В благодарностях он пишет прямо: именно неожиданный контрпример Добрибана заново разжег интерес к проекту. Дальше события пошли с той скоростью, ради которой эту историю и стоит рассказывать.
Сначала о том, что вообще сломали. Представьте, что вы разом проверяете двадцать тысяч гипотез — скажем, ищете гены, связанные с болезнью. Привычный порог "p меньше 0.05" здесь бесполезен: даже при полном отсутствии эффекта примерно каждый двадцатый ген покажется значимым, то есть около тысячи ложных находок на ровном месте. Классическое лекарство — поправка Бонферрони, делим порог на число гипотез. Работает, но душит: при двадцати тысячах гипотез искать придется на уровне 0.0000025, и настоящие эффекты утонут вместе с ложными.
В 1995 году Йоав Бенджамини и Йосеф Хохберг предложили другое. Контролировать не вероятность хотя бы одной…