Wynik p>0,05 oznacza jedynie, że zastosowany test nie dostarczył wystarczająco silnych podstaw do odrzucenia hipotezy zerowej przy przyjętym progu. Nie dowodzi, że efekt jest dokładnie zerowy ani że dwie grupy są równoważne. Mała próba, duży szum lub słaby pomiar mogą sprawić, że nawet realna różnica będzie statystycznie nieistotna. Altman i Bland podsumowali ten problem słynnym zdaniem „absence of evidence is not evidence of absence”. Jeśli naprawdę chcemy wykazać, że różnica jest wystarczająco mała, potrzebujemy odpowiedniego projektu, przedziałów ufności lub testów równoważności.
Nonresponse bias pojawia się wtedy, gdy osoby, które odpowiadają na badanie, różnią się w istotny sposób od osób, których nie udało się skontaktować lub które odmówiły. Sam niski odsetek odpowiedzi nie mówi jednak, jak duży jest bias. Pew Research Center pokazał na badaniach telefonicznych, że przy response rate około 9% wiele estymacji nadal było bliskich benchmarkom, podczas gdy niektóre — np. dotyczące aktywności obywatelskiej — były wyraźnie zawyżone. Liczy się więc nie tylko ilu ludzi odpowiedziało, lecz czy prawdopodobieństwo odpowiedzi jest związane z badaną cechą.
Nie wszystkie braki danych są równoważne. W klasycznej taksonomii rozróżnia się m.in. MCAR, MAR i MNAR. Najtrudniejszy przypadek, Missing Not At Random, występuje wtedy, gdy prawdopodobieństwo braku zależy od wartości, której nie obserwujemy, nawet po uwzględnieniu dostępnych informacji. Przykładowo osoby z najbardziej skrajnym wynikiem mogą być najmniej skłonne go ujawnić. Wtedy analiza samych obserwowanych przypadków może być systematycznie przesunięta, a brakujących wartości nie da się wiarygodnie „odtworzyć” bez dodatkowych, często niesprawdzalnych założeń.
Kwartet Anscombe’a składa się z czterech małych zbiorów par liczb, które mają niemal identyczne podstawowe statystyki: podobne średnie i wariancje zmiennych, ten sam współczynnik korelacji i niemal tę samą prostą regresji. Gdy jednak narysuje się wykresy punktowe, układy wyglądają radykalnie inaczej: jeden przypomina relację liniową, drugi krzywą, trzeci jest zdominowany przez obserwację odstającą, a czwarty ma prawie wszystkie punkty w pionowej linii. Matematyczne podsumowanie może więc być poprawne, a jednocześnie nie ujawniać najważniejszej struktury danych.
Survivorship bias pojawia się, gdy analizujemy tylko jednostki, które przeszły jakiś proces selekcji, a pomijamy te, które odpadły. Słynny wojenny przykład dotyczy prac Abrahama Walda nad podatnością samolotów: dane pochodziły z maszyn, które wróciły z misji, więc uszkodzenia na nich mówiły przede wszystkim, gdzie samolot mógł zostać trafiony i nadal wrócić. Formalny problem był bardziej złożony niż internetowa anegdota o „kulach na skrzydłach”, ale sedno pozostaje ważne: brakujące obserwacje mogą zawierać najważniejszą informację.
Dwa szeregi czasowe mogą wykazywać imponującą korelację i bardzo dobre dopasowanie regresji, mimo że nie istnieje między nimi sensowna zależność. Wystarczy, że oba mają trend, długą pamięć lub inne niestacjonarne własności. Klasyczna praca Grangera i Newbolda pokazała, że regresja niezależnych procesów tego typu może produkować wysokie R² i pozornie istotne współczynniki. To matematyczne źródło wielu absurdalnych „korelacji”: problemem nie jest samo współwystępowanie zmian, lecz traktowanie danych czasowych tak, jakby były niezależnymi punktami bez własnej dynamiki.
Próg p<0,05 kontroluje ryzyko fałszywego alarmu dla pojedynczego testu pod jego założeniami — nie dla dowolnie dużej rodziny testów. Jeśli wykonasz 20 niezależnych testów przy prawdziwych hipotezach zerowych i każdy ma poziom 5%, prawdopodobieństwo co najmniej jednego wyniku poniżej 0,05 wynosi około 64%, a nie 5%. To nie oznacza, że każdy zestaw 20 testów da taki wynik, ani że testy w praktyce są niezależne. Pokazuje jednak mechanizm wielokrotnych porównań: im więcej okazji do trafienia, tym mniej zaskakujące staje się pojedyncze „znaczące” trafienie.
Współczynnik korelacji Pearsona mierzy siłę zależności liniowej, a nie dowolnej zależności. Dlatego dwie zmienne mogą być powiązane w sposób całkowicie deterministyczny — jedna może dokładnie wynikać z drugiej — a korelacja nadal może wynosić zero. Klasyczny przykład to symetryczna zależność paraboliczna: dodatnie i ujemne nachylenia po obu stronach środka wzajemnie się znoszą. „Brak korelacji” oznacza więc brak liniowego trendu mierzonego daną statystyką, a nie automatycznie brak związku, przewidywalności czy mechanizmu.
Bardzo duża próba może dać niezwykle precyzyjny, a jednocześnie systematycznie błędny wynik. Klasyczny przykład to sondaż „Literary Digest” z 1936 roku: magazyn rozesłał około 10 milionów kart i otrzymał około 2,4 miliona odpowiedzi, a mimo to błędnie przewidział zwycięzcę wyborów prezydenckich w USA. Późniejsze analizy wskazały zarówno bias ramy doboru, jak i silny bias odpowiedzi. Matematyczna lekcja jest ponadczasowa: zwiększanie n zmniejsza przypadkowy błąd próbkowania, ale nie usuwa systematycznego błędu tego, kto w ogóle trafia do danych.
Winner’s curse w statystyce powstaje, gdy wybieramy największy spośród wielu zaszumionych oszacowań. Zwycięzca trafia na pierwsze miejsce nie tylko dlatego, że ma wysoki prawdziwy efekt, lecz często także dlatego, że jego błąd losowy był wyjątkowo korzystny. Dlatego oszacowanie efektu dokładnie w tej samej próbce, w której wybrano „najlepszy” wariant, jest przeciętnie zawyżone. Zjawisko jest dobrze znane m.in. w badaniach asocjacyjnych genów, ale dotyczy także rankingów, konkursów modeli, A/B testów i rekordowych wyników.
Istotność statystyczna zależy nie tylko od wielkości efektu, lecz także od precyzji jego oszacowania. Gdy próbka jest ogromna, błąd standardowy maleje i nawet bardzo mała różnica może dać bardzo niskie p-value. Dlatego „statystycznie istotne” nie znaczy „duże”, „ważne” ani „warte działania”. American Statistical Association podkreśla, że p-value nie mierzy wielkości efektu ani znaczenia wyniku. W praktyce trzeba patrzeć na estymatę, przedział niepewności i próg ważności wynikający z dziedziny, a nie tylko na to, po której stronie 0,05 znalazła się liczba.
P-value jest prawdopodobieństwem uzyskania danych co najmniej tak niezgodnych z określonym modelem zerowym jak obserwowane, przy założeniu tego modelu i pozostałych założeń testu. Nie jest prawdopodobieństwem, że hipoteza zerowa jest prawdziwa po zobaczeniu danych, nie jest też „szansą, że wynik powstał przypadkiem”. American Statistical Association wymieniła to jako jedno z kluczowych nieporozumień: p-value może informować o niezgodności danych z modelem, ale samo nie mierzy prawdopodobieństwa hipotezy, wielkości efektu ani znaczenia naukowego.
Jeżeli badacz co jakiś czas sprawdza zwykły test p<0,05 i zatrzymuje zbieranie danych dokładnie wtedy, gdy próg zostanie przekroczony, rzeczywisty odsetek fałszywie dodatnich wyników może przekroczyć nominalne 5%. Problemem nie jest samo analizowanie danych w trakcie badania — istnieją poprawne metody sekwencyjne — lecz używanie procedury zaprojektowanej dla ustalonego planu tak, jakby liczba kolejnych okazji do zatrzymania nie miała znaczenia. Optional stopping jest szczególnym przypadkiem szerszej zasady: reguła, według której dane trafiają do finalnego raportu, jest częścią modelu statystycznego.
Paradoks Berksona pokazuje, że dwie cechy niezależne w całej populacji mogą zacząć wyglądać na powiązane po ograniczeniu analizy do specjalnie wybranej grupy. Dzieje się tak, gdy do tej grupy łatwiej trafić z powodu jednej albo drugiej cechy. Warunkujemy wtedy na wspólny skutek — tak zwany collider — i otwieramy statystyczne powiązanie, którego wcześniej nie było. To ważne ostrzeżenie dla badań szpitalnych, rekrutacji, konkursów i wszelkich analiz wykonywanych wyłącznie na osobach, które przeszły jakiś filtr.
„Przeciętna” nie jest jedną uniwersalną liczbą. Średnia arytmetyczna uwzględnia wielkość każdego wyniku, więc pojedyncze ekstremalne obserwacje i długi ogon rozkładu mogą ją mocno przesunąć. Mediana patrzy tylko na kolejność: połowa wyników leży poniżej niej, połowa powyżej. W symetrycznych danych obie wartości bywają podobne, ale w rozkładach skośnych mogą się znacznie różnić. Żadna z nich nie jest automatycznie „prawdziwsza” — odpowiadają na inne pytania, a wybór jednej może zmienić narrację o płacach, cenach czy czasie oczekiwania.
Paradoks Simpsona pokazuje, że relacja widoczna osobno w kilku grupach może osłabnąć, zniknąć, a nawet odwrócić kierunek po połączeniu wszystkich obserwacji. Nie jest to błąd rachunkowy: procenty w każdej tabeli mogą być policzone poprawnie. Problem pojawia się wtedy, gdy grupy różnią się ważną zmienną trzecią i mają różne liczebności. Agregacja miesza dwa efekty naraz: zależność wewnątrz grup oraz różnice między samymi grupami. Dlatego jedno zbiorcze porównanie może prowadzić do zupełnie innego wniosku niż analiza warstwowa.
Błąd ekologiczny powstaje, gdy zależność obserwowaną na poziomie grup — miast, szkół, regionów czy krajów — przenosimy automatycznie na pojedynczych ludzi. Grupa z wyższą średnią X może mieć także wyższą średnią Y, mimo że wewnątrz każdej grupy osoby z wyższym X mają niższe Y albo nie ma między nimi żadnej zależności. W. S. Robinson pokazał w 1950 roku, że korelacje liczone z danych zagregowanych mogą radykalnie różnić się od korelacji indywidualnych. Agregaty są prawdziwymi danymi, ale jednostką analizy jest grupa, nie człowiek.
Regresja do średniej sprawia, że bardzo skrajny wynik w pierwszym pomiarze często staje się mniej skrajny przy kolejnym, nawet jeśli nic istotnego się nie zmieniło. Dzieje się tak, gdy wynik jest mieszaniną trwałej cechy i losowego składnika: rekordowy rezultat zwykle zawiera nie tylko sygnał, lecz także wyjątkowo sprzyjający lub niesprzyjający przypadek. Przy następnym pomiarze taki sam ekstremalny zbieg okoliczności jest mniej prawdopodobny. Bez grupy kontrolnej łatwo więc przypisać naturalny powrót ku typowej wartości leczeniu, treningowi, karze lub innej interwencji.