Ogromna próba może uczynić „istotnym” efekt bez praktycznego znaczenia
Istotność statystyczna zależy nie tylko od wielkości efektu, lecz także od precyzji jego oszacowania. Gdy próbka jest ogromna, błąd standardowy maleje i nawet bardzo mała różnica może dać bardzo niskie p-value. Dlatego „statystycznie istotne” nie znaczy „duże”, „ważne” ani „warte działania”. American Statistical Association podkreśla, że p-value nie mierzy wielkości efektu ani znaczenia wyniku. W praktyce trzeba patrzeć na estymatę, przedział niepewności i próg ważności wynikający z dziedziny, a nie tylko na to, po której stronie 0,05 znalazła się liczba.
Dlaczego n zmienia p
W wielu standardowych modelach niepewność oszacowania maleje mniej więcej jak 1/√n. Jeśli prawdziwa różnica jest mała, przy niewielkiej próbie trudno odróżnić ją od szumu. Przy milionach obserwacji ten sam efekt można oszacować bardzo precyzyjnie. Statystyka testowa rośnie, a p-value może stać się mikroskopijne, choć sam efekt pozostaje dokładnie tak mały jak wcześniej.
Przykład bez sensacyjnych liczb
Wyobraź sobie system, w którym nowa wersja zwiększa średni wynik o 0,01 jednostki. Przy 100 obserwacjach ta różnica może być całkowicie niewidoczna statystycznie. Przy setkach milionów obserwacji może być oszacowana z wielką precyzją i mieć p znacznie poniżej 0,05. Pytanie biznesowe lub naukowe nadal brzmi jednak: czy 0,01 jednostki ma znaczenie?
Statystyczna a praktyczna istotność
Statystyczna istotność dotyczy niezgodności danych z określonym modelem zerowym. Praktyczna istotność wymaga jednostek i kontekstu: ile sekund oszczędzamy, o ile zmienia się ryzyko, jaki jest koszt, czy zmiana jest dostrzegalna. Nie da się wyprowadzić tej odpowiedzi z p-value. Dwie dziedziny mogą zupełnie inaczej oceniać ten sam rozmiar efektu.
Przedział pomaga zobaczyć skalę
Estymata z przedziałem niepewności pokazuje zarówno najlepsze oszacowanie, jak i precyzję. Przy ogromnej próbie przedział może być bardzo wąski wokół małej wartości. To sytuacja, w której możemy być bardzo pewni, że efekt istnieje statystycznie i jednocześnie bardzo pewni, że jest niewielki. Takie rozróżnienie znika, gdy raport ogranicza się do gwiazdki „p<0,05”.
Duże dane nie usuwają innych biasów
Miliony obserwacji zmniejszają błąd losowy, ale nie naprawiają confoundingu, złego pomiaru, selekcji czy błędnej definicji wyniku. Wielkie n może wręcz dać fałszywe poczucie pewności, bo przedziały modelowe są bardzo wąskie, podczas gdy dominujący problem jest systematyczny i niewidoczny w standardowym błędzie.
Jak raportować sensownie
Przed analizą warto ustalić minimalnie ważny efekt, jeśli kontekst na to pozwala. W raporcie należy podać wielkość efektu w zrozumiałych jednostkach, przedział niepewności oraz p-value, jeśli jest potrzebne. Wtedy czytelnik może odróżnić trzy pytania: czy efekt jest wykrywalny, jak duży jest oraz czy ma znaczenie. To trzy różne sprawy.
Matematyka dużego n
W wielu prostych modelach błąd standardowy oszacowania maleje w przybliżeniu jak 1/√n. Jeśli więc prawdziwy efekt jest bardzo mały, zwiększanie liczby obserwacji może sprawić, że stosunek efektu do jego błędu standardowego stanie się wystarczająco duży, aby przekroczyć umowny próg testu. To nie jest wada dużych prób — większa precyzja jest zaletą. Problem pojawia się wtedy, gdy decyzję o znaczeniu wyniku opiera się wyłącznie na p-value. Przy milionach obserwacji można bardzo precyzyjnie wykryć różnicę, która z perspektywy praktycznej jest pomijalna. Dlatego obok istotności statystycznej potrzebne są wielkość efektu, przedział niepewności i kontekst określający, jaka zmiana byłaby rzeczywiście ważna. Precyzja odpowiada więc na pytanie, jak dokładnie znamy efekt, a nie czy jego wielkość jest ważna w praktyce.