„Nieistotny statystycznie” nie znaczy „udowodniono brak efektu”
Wynik p>0,05 oznacza jedynie, że zastosowany test nie dostarczył wystarczająco silnych podstaw do odrzucenia hipotezy zerowej przy przyjętym progu. Nie dowodzi, że efekt jest dokładnie zerowy ani że dwie grupy są równoważne. Mała próba, duży szum lub słaby pomiar mogą sprawić, że nawet realna różnica będzie statystycznie nieistotna. Altman i Bland podsumowali ten problem słynnym zdaniem „absence of evidence is not evidence of absence”. Jeśli naprawdę chcemy wykazać, że różnica jest wystarczająco mała, potrzebujemy odpowiedniego projektu, przedziałów ufności lub testów równoważności.
Nieodrzucenie to nie akceptacja
Klasyczny test hipotezy jest asymetryczny. Definiujemy H0 i pytamy, czy dane są z nią wystarczająco niezgodne, by ją odrzucić. Jeśli dowód jest za słaby, pozostajemy przy „nie odrzucamy”. Logicznie nie jest to to samo co „udowodniliśmy H0”. Brak skazania z powodu niewystarczających dowodów nie jest matematycznym dowodem niewinności; analogia nie jest idealna, ale dobrze pokazuje asymetrię procedury.
Moc badania ma znaczenie
Test może nie wykryć istniejącego efektu, gdy próba jest mała lub dane są zmienne. Moc to prawdopodobieństwo wykrycia określonego efektu przy danym projekcie i progu. Jeśli moc jest niska, wynik p>0,05 może być zgodny zarówno z brakiem efektu, jak i z szerokim zakresem efektów dodatnich lub ujemnych. Sama etykieta „nieistotne” ukrywa tę niepewność.
Przedział ufności mówi więcej
Oszacowanie efektu z przedziałem pokazuje, jakie wielkości są zgodne z danymi w ramach modelu. Jeśli przedział jest szeroki i obejmuje zarówno zero, jak i efekty praktycznie duże, badanie jest po prostu mało rozstrzygające. Jeśli cały przedział leży w bardzo wąskim obszarze wokół zera, mamy mocniejszą podstawę do stwierdzenia, że duży efekt jest nieprawdopodobny.
Równoważność wymaga własnej hipotezy
Gdy celem jest pokazanie, że dwa rozwiązania różnią się o mniej niż ustalony praktycznie próg, stosuje się testy równoważności lub podejścia non-inferiority, zależnie od pytania. Najpierw trzeba określić, jaka różnica byłaby jeszcze istotna praktycznie. Zwykłe „p>0,05” wobec testu różnicy równej zero nie robi tego zadania.
Dlaczego błąd jest tak częsty
Publikacje i raporty często wymuszają prosty język: „było” albo „nie było różnicy”. Testy statystyczne są jednak probabilistyczne i zależą od precyzji. Dwa badania mogą oszacować identyczny efekt, ale jedno z większą próbą da p<0,05, a drugie p>0,05. Ogłoszenie, że pierwszy wykazał efekt, a drugi jego brak, sztucznie tworzy sprzeczność.
Lepszy sposób raportowania
Zamiast skupiać się na etykiecie progu, warto podawać estymatę, przedział niepewności, wielkość próby i wcześniej ustalony próg praktycznej ważności. To pozwala odróżnić „dane wskazują na bardzo mały efekt” od „dane są tak nieprecyzyjne, że niewiele możemy powiedzieć”. Oba przypadki mogą mieć p>0,05, ale naukowo są zupełnie różne.
Wąski przedział wokół zera mówi coś innego niż szeroki
Dwa badania mogą mieć to samo p > 0,05, a jednak dostarczać bardzo różnej wiedzy. Jeśli przedział ufności jest szeroki i obejmuje zarówno istotną korzyść, brak efektu, jak i istotną szkodę, dane są po prostu mało precyzyjne. Jeśli natomiast duże, dobrze zaprojektowane badanie daje wąski przedział skupiony wokół zera, może ono wykluczać efekty większe niż ustalona praktycznie ważna granica. Nadal nie wynika to z samego słowa „nieistotne”; potrzebna jest skala efektu, niepewność i wcześniej określone kryterium. Właśnie dlatego badania równoważności i non-inferiority mają odrębną logikę testowania. „Nie znaleźliśmy różnicy” i „wykazaliśmy, że różnica jest wystarczająco mała” to statystycznie różne twierdzenia.