MatematykaStatystyka — jak prawdziwe liczby mogą prowadzić do błędnych wniosków

Cztery zupełnie różne zbiory danych mogą mieć niemal identyczne statystyki

Kwartet Anscombe’a składa się z czterech małych zbiorów par liczb, które mają niemal identyczne podstawowe statystyki: podobne średnie i wariancje zmiennych, ten sam współczynnik korelacji i niemal tę samą prostą regresji. Gdy jednak narysuje się wykresy punktowe, układy wyglądają radykalnie inaczej: jeden przypomina relację liniową, drugi krzywą, trzeci jest zdominowany przez obserwację odstającą, a czwarty ma prawie wszystkie punkty w pionowej linii. Matematyczne podsumowanie może więc być poprawne, a jednocześnie nie ujawniać najważniejszej struktury danych.

Pomysł Anscombe’a

Francis Anscombe opublikował w 1973 roku artykuł „Graphs in Statistical Analysis”, w którym pokazał zestawy dziś znane jako kwartet Anscombe’a. Jego argument nie był skierowany przeciw statystyce liczbowej, lecz przeciw analizie bez oglądania danych. Kilka standardowych miar może być identycznych dla zbiorów, które wizualnie reprezentują zupełnie różne sytuacje.

Co pozostaje takie samo

W klasycznym kwartecie cztery zbiory zostały skonstruowane tak, by ich podstawowe podsumowania były prawie takie same: średnie x i y, wariancje, korelacja oraz parametry prostej regresji. Gdyby analysta zobaczył wyłącznie tabelkę z tymi liczbami, mógłby uznać, że cztery przypadki są niemal równoważne. Z perspektywy jednego modelu liniowego faktycznie wyglądają podobnie.

Co ujawnia wykres

Wykresy pokazują coś zupełnie innego. Jeden zbiór ma rozsądny liniowy trend z rozrzutem. Drugi układa się w wyraźną krzywą, więc prosta jest złym modelem. Trzeci wygląda liniowo głównie dlatego, że jeden punkt odstający silnie wpływa na regresję. W czwartym niemal wszystkie wartości x są takie same, a pojedyncza obserwacja nadaje korelacji i regresji pozór użyteczności. Ta sama statystyka może więc powstawać z odmiennych geometrii danych.

Dlaczego podsumowanie nie wystarcza

Średnia, wariancja i korelacja są kompresją. Celowo wyrzucają część informacji, aby ułatwić opis. To zaleta, dopóki usunięta informacja nie jest właśnie tą, która decyduje o interpretacji: nieliniowość, klastry, heteroskedastyczność, wartości odstające albo błędy pomiaru. Kwartet jest celowo skonstruowanym przykładem pokazującym granice takiej kompresji.

Ta lekcja jest dziś jeszcze ważniejsza

Współczesne analizy potrafią generować setki wskaźników i modeli, a dashboardy często pokazują kilka liczb bez surowych danych. Kwartet Anscombe’a przypomina, że model może mieć dobre współczynniki i nadal opisywać niewłaściwy kształt zależności. Diagnostyka reszt, wykresy punktowe, rozkłady i kontrola wartości odstających nie są dekoracją po analizie — są częścią sprawdzania, czy liczby znaczą to, co sądzimy.

Nie oznacza to „zawsze ufaj oczom”

Wykres także może mylić: skala osi, sposób próbkowania, nakładanie punktów czy dobór zakresu zmieniają percepcję. Wniosek jest bardziej wyważony: analiza liczbowa i wizualizacja uzupełniają się. Liczby dają precyzję, wykresy pokazują strukturę, a sensowny model powinien przejść oba testy. Kwartet Anscombe’a jest jednym z najlepszych dowodów, że poprawne statystyki opisowe nie gwarantują dobrego zrozumienia danych.

Co dokładnie pokazuje kwartet

Siła kwartetu Anscombe’a polega na tym, że podobieństwo nie dotyczy jednej wybranej liczby. Cztery zbiory skonstruowano tak, aby miały niemal te same podstawowe podsumowania: średnie zmiennych, wariancje, współczynnik korelacji oraz tę samą prostą regresji liniowej. Dopiero wykres ujawnia, że w jednym przypadku punkty tworzą sensowną liniową chmurę, w innym układają się nieliniowo, w kolejnym pojedyncza obserwacja skrajna silnie wpływa na dopasowanie, a jeszcze inny zbiór jest zdominowany przez punkt o dużej dźwigni. To nie jest argument przeciw statystykom podsumowującym. Jest argumentem przeciw traktowaniu ich jako kompletnego opisu struktury danych. Ten sam zestaw liczb może być zgodny z bardzo różnymi mechanizmami generującymi obserwacje.

#EDA#korelacja#kwartet Anscombe’a#outlier#regresja#wizualizacja danych
Źródła i weryfikacja
Otrzymuj codzienne losowe ciekawostki