p < 0,05 nie oznacza 95% szans, że hipoteza jest prawdziwa
P-value jest prawdopodobieństwem uzyskania danych co najmniej tak niezgodnych z określonym modelem zerowym jak obserwowane, przy założeniu tego modelu i pozostałych założeń testu. Nie jest prawdopodobieństwem, że hipoteza zerowa jest prawdziwa po zobaczeniu danych, nie jest też „szansą, że wynik powstał przypadkiem”. American Statistical Association wymieniła to jako jedno z kluczowych nieporozumień: p-value może informować o niezgodności danych z modelem, ale samo nie mierzy prawdopodobieństwa hipotezy, wielkości efektu ani znaczenia naukowego.
Warunek jest skierowany w drugą stronę
P-value ma postać logiczną zbliżoną do P(dane tak ekstremalne lub bardziej | H0 i model). Popularna interpretacja próbuje odczytać P(H0 | dane). To inne prawdopodobieństwo warunkowe. Zamiana kierunku warunku jest tym samym rodzajem błędu, który pojawia się przy myleniu „szansy pozytywnego testu u zdrowej osoby” z „szansą bycia zdrowym po pozytywnym teście”.
Co oznacza małe p
Małe p mówi, że obserwowany wynik byłby nietypowy w modelu zerowym — o ile model, sposób zbierania danych i procedura testowa są poprawnie określone. Może to być argument przeciw H0, ale siła tego argumentu zależy także od projektu, jakości danych, wielokrotności analiz i innych założeń. P=0,01 nie jest automatycznym certyfikatem prawdziwego odkrycia.
Czego p-value nie mierzy
ASA podkreśliła, że p-value nie mierzy rozmiaru efektu ani jego praktycznej ważności. Bardzo mały efekt przy ogromnej próbie może mieć ekstremalnie małe p. Z kolei umiarkowany efekt w małej próbie może nie przekroczyć 0,05. Dlatego do interpretacji potrzebne są estymaty efektu, przedziały niepewności, kontekst dziedzinowy i jakość projektu.
Dlaczego próg 0,05 stał się problemem
Dychotomia „istotne/nieistotne” zachęca do traktowania p=0,049 i p=0,051 jak jakościowo różnych światów. ASA w swoim stanowisku krytykowała podejmowanie decyzji naukowych wyłącznie na podstawie przekroczenia arbitralnego progu. Ciągła miara dowodu zostaje wtedy zamieniona w przełącznik, a drobny szum może decydować o narracji.
Jak można mówić precyzyjniej
Zamiast „istnieje 95% szans, że efekt jest prawdziwy” można napisać: „przy założonym modelu zerowym wynik co najmniej tak ekstremalny występowałby z p=...”. Potem należy podać oszacowanie efektu i niepewność. Jeśli chcemy bezpośrednio mówić o prawdopodobieństwie hipotez, potrzebujemy innego aparatu — np. modelu bayesowskiego z jawnymi założeniami o prawdopodobieństwach a priori.
Najważniejsze jest pytanie badawcze
Statystyka nie sprowadza jakości dowodu do jednego numeru. P-value odpowiada na wąskie pytanie dotyczące zgodności danych z modelem. To może być użyteczne, lecz nie zastępuje oceny projektu, replikacji, mechanizmu, rozmiaru efektu i potencjalnych biasów. Paradoks polega na tym, że im częściej p-value używa się jako prostego werdyktu, tym dalej od jego rzeczywistego znaczenia.
Dlaczego intuicja Bayesowska kusi do złej interpretacji
Pomieszanie P(dane | H0) z P(H0 | dane) jest tym samym rodzajem odwrócenia warunku, który pojawia się w wielu problemach prawdopodobieństwa. p-value jest obliczane przy założeniu konkretnego modelu zerowego i pyta o zgodność danych — lub wyników co najmniej tak ekstremalnych — z tym modelem. Aby otrzymać prawdopodobieństwo hipotezy po zobaczeniu danych, trzeba wprowadzić dodatkowe składniki modelu, między innymi wcześniejsze prawdopodobieństwa hipotez i model wyników pod alternatywą. Klasyczny test istotności tego nie robi. Dlatego nawet bardzo małe p nie jest matematycznie przeliczalne na prosty procent pewności, że odkrycie jest prawdziwe. To dwa różne pytania probabilistyczne.