Jeśli sprawdzisz wystarczająco wiele hipotez, coś „istotnego” znajdzie się przypadkiem
Próg p<0,05 kontroluje ryzyko fałszywego alarmu dla pojedynczego testu pod jego założeniami — nie dla dowolnie dużej rodziny testów. Jeśli wykonasz 20 niezależnych testów przy prawdziwych hipotezach zerowych i każdy ma poziom 5%, prawdopodobieństwo co najmniej jednego wyniku poniżej 0,05 wynosi około 64%, a nie 5%. To nie oznacza, że każdy zestaw 20 testów da taki wynik, ani że testy w praktyce są niezależne. Pokazuje jednak mechanizm wielokrotnych porównań: im więcej okazji do trafienia, tym mniej zaskakujące staje się pojedyncze „znaczące” trafienie.
Pięć procent dotyczy pojedynczej procedury
W klasycznym teście o poziomie α=0,05, przy prawdziwej hipotezie zerowej i spełnionych założeniach, procedura odrzuca H0 w około 5% powtórzeń. Ta gwarancja nie mówi, że w całym projekcie badawczym szansa jakiegokolwiek fałszywego alarmu pozostaje 5%, jeśli testujemy dziesiątki zmiennych, grup, punktów czasowych i wariantów modelu.
Prosta matematyka rodziny testów
Przy m niezależnych testach prawdopodobieństwo, że żaden nie da fałszywie dodatniego wyniku, wynosi (1−α)^m. Dla 20 testów i α=0,05 to około 0,95^20≈0,358. Zatem szansa co najmniej jednego trafienia to około 1−0,358≈0,642. To obliczenie jest ilustracją; przy zależnych testach dokładna wartość się zmienia, ale ogólny problem pozostaje.
Dlaczego analiza po fakcie bywa zdradliwa
Jeżeli badacz sprawdza wiele wariantów, a potem pokazuje wyłącznie ten z najmniejszym p, czytelnik widzi jeden test, lecz proces generujący wynik zawierał wiele prób. Nominalne 0,05 nie opisuje wtedy całej ścieżki selekcji. To matematyczne jądro problemów określanych jako multiple testing, data dredging czy część praktyk p-hackingowych.
Korekcje nie są karą za ciekawość
Procedury Bonferroniego, Holma, kontroli FDR i inne metody istnieją właśnie po to, by jasno określić, jaki rodzaj błędu chcemy kontrolować w rodzinie porównań. NIST podkreśla, że wielokrotne porównania wymagają specjalnych procedur; powtarzanie zwykłych testów parami „jak gdyby każdy był jedyny” nie działa ogólnie.
Nie każda eksploracja musi być testem potwierdzającym
Eksploracyjne szukanie wzorców jest wartościowe, jeśli uczciwie traktujemy wyniki jako hipotezy do dalszego sprawdzenia. Problem powstaje wtedy, gdy proces szerokiego poszukiwania zostaje ukryty, a znaleziony sygnał przedstawiony tak, jakby był jedyną zaplanowaną analizą. Replikacja na nowych danych jest wtedy szczególnie ważna.
Jak czytać pojedyncze p
Pytanie powinno brzmieć: ile decyzji analitycznych i testów doprowadziło do tego wyniku? Czy rodzina hipotez była zdefiniowana wcześniej? Czy zastosowano korekcję, kontrolę FDR albo niezależny zbiór walidacyjny? Pojedyncze p-value bez informacji o przestrzeni poszukiwania może wyglądać dużo bardziej niezwykle, niż było naprawdę.
Jak szybko rośnie ryzyko fałszywego alarmu
Jeżeli wykonujemy 20 niezależnych testów, w każdym używając poziomu 0,05, i wszystkie hipotezy zerowe są prawdziwe, prawdopodobieństwo że żaden test nie da fałszywie „istotnego” wyniku wynosi 0,95^20, czyli około 36%. Oznacza to około 64% szans na co najmniej jeden taki wynik w całej rodzinie testów. To prosta ilustracja, dlaczego pojedyncze p < 0,05 nie może być interpretowane w oderwaniu od liczby wykonanych porównań. Rzeczywiste analizy bywają bardziej złożone, bo testy mogą być zależne, a pytania różnić się ważnością, ale mechanizm pozostaje: procedura wyboru spośród wielu wyników zmienia częstość fałszywych odkryć. Stąd metody kontrolujące rodzinny błąd lub false discovery rate. Nawet wtedy trzeba dobrać metodę kontroli błędu do celu analizy, bo kontrolowanie choć jednego fałszywego alarmu i kontrolowanie oczekiwanego odsetka fałszywych odkryć to różne zadania.