Najlepszy wynik w dużym konkursie zwykle przecenia prawdziwą przewagę zwycięzcy
Winner’s curse w statystyce powstaje, gdy wybieramy największy spośród wielu zaszumionych oszacowań. Zwycięzca trafia na pierwsze miejsce nie tylko dlatego, że ma wysoki prawdziwy efekt, lecz często także dlatego, że jego błąd losowy był wyjątkowo korzystny. Dlatego oszacowanie efektu dokładnie w tej samej próbce, w której wybrano „najlepszy” wariant, jest przeciętnie zawyżone. Zjawisko jest dobrze znane m.in. w badaniach asocjacyjnych genów, ale dotyczy także rankingów, konkursów modeli, A/B testów i rekordowych wyników.
Selekcja wybiera także szczęście
Załóżmy, że testujemy 100 wariantów o podobnej prawdziwej jakości. Każdy wynik jest prawdziwą wartością plus losowy szum. Wybierając największy zaobserwowany wynik, preferujemy warianty, które dostały dodatni błąd losowy. Nawet jeśli zwycięzca faktycznie jest jednym z lepszych, jego obserwowany wynik ma tendencję do przeceniania własnej przewagi.
Dlaczego replikacja bywa rozczarowująca
W nowej próbie błąd losowy jest losowany ponownie. Szczęśliwy składnik, który pomógł wygrać pierwszy konkurs, zwykle nie powtarza się w tej samej skali. Efekt w replikacji często „kurczy się”. To nie musi znaczyć, że pierwotny wynik był oszustwem albo że prawdziwy efekt wynosi zero; część spadku jest mechaniczną konsekwencją selekcji maksimum.
Badania genetyczne dają czysty przykład
W badaniach genome-wide testuje się ogromną liczbę wariantów i szczególną uwagę poświęca tym, które przekraczają próg istotności. Literatura pokazuje, że efekty nowo wykrytych asocjacji mają tendencję do bycia zawyżonymi — zjawisko nazywane winner’s curse. Korekty selekcji i niezależne próby replikacyjne pomagają uzyskać mniej obciążone oszacowania.
To kuzyn regresji do średniej, ale nie to samo
Oba zjawiska wykorzystują ekstremalne, zaszumione wyniki, dlatego są blisko spokrewnione. Regresja do średniej dotyczy przewidywania kolejnego pomiaru skrajnego przypadku. Winner’s curse podkreśla dodatkowo fakt wyboru zwycięzcy spośród wielu kandydatów. Im większa pula i im większy szum, tym więcej „szczęścia” może znaleźć się w maksimum.
Gdzie występuje poza nauką
Firma wybiera najlepszą kampanię z 50 eksperymentów i zakłada, że jej zmierzony uplift utrzyma się po wdrożeniu. Fundusz reklamuje menedżera o najwyższym historycznym zwrocie. Liga wybiera debiutanta z rekordowym pierwszym sezonem. W każdym przypadku ranking oparty na zaszumionych pomiarach naturalnie selekcjonuje część dodatnich fluktuacji.
Jak ograniczać klątwę zwycięzcy
Najbardziej przejrzyste rozwiązanie to oddzielić dane selekcyjne od danych oceniających: wybrać wariant na jednym zbiorze, a efekt zmierzyć na niezależnym. Stosuje się też modele hierarchiczne, shrinkage, korekty po selekcji i cross-validation. Wspólna idea brzmi: nie traktuj maksimum z tej samej próby jako nieobciążonej estymaty jego przyszłej przewagi.
Dlaczego zwycięzca jest szczególną próbą
Wyobraźmy sobie wiele kandydatów o podobnej prawdziwej jakości, których wyniki pomiaru zawierają losowy szum. Jeśli wybierzemy największy zaobserwowany wynik, zwycięzca ma większą niż przeciętna szansę na dodatni błąd pomiaru — właśnie dlatego znalazł się na szczycie. Następny, niezależny pomiar nie jest już warunkowany tym samym szczęśliwym odchyleniem, więc wynik często spada. Mechanizm jest selekcyjny, a nie psychologiczny: dotyczy genów wybranych w badaniu asocjacyjnym, najlepszego funduszu z rankingu, najbardziej skutecznej kampanii czy rekordowego sportowca, jeśli porównujemy zaszumione estymaty. Im więcej kandydatów przeszukujemy i im większy szum, tym silniejsze może być zawyżenie zwycięskiego oszacowania.