Dwie niezależne rzeczy mogą mieć wysoką korelację tylko dlatego, że obie zmieniają się z czasem
Dwa szeregi czasowe mogą wykazywać imponującą korelację i bardzo dobre dopasowanie regresji, mimo że nie istnieje między nimi sensowna zależność. Wystarczy, że oba mają trend, długą pamięć lub inne niestacjonarne własności. Klasyczna praca Grangera i Newbolda pokazała, że regresja niezależnych procesów tego typu może produkować wysokie R² i pozornie istotne współczynniki. To matematyczne źródło wielu absurdalnych „korelacji”: problemem nie jest samo współwystępowanie zmian, lecz traktowanie danych czasowych tak, jakby były niezależnymi punktami bez własnej dynamiki.
Korelacja trendów
Jeśli jedna zmienna rośnie przez kilkadziesiąt lat i druga również rośnie, punkty obu serii będą miały podobną kolejność w czasie. Zwykła korelacja może więc być wysoka, nawet gdy procesy nie oddziałują na siebie. Czas staje się ukrytą wspólną osią. To samo dotyczy dwóch spadających serii albo procesów, które są silnie zależne od własnej przeszłości.
Klasyczny problem regresji pozornej
Granger i Newbold w 1974 roku zwrócili uwagę na regresje, które mają pozornie świetne statystyki dopasowania, ale bardzo słabe własności diagnostyczne. W niestacjonarnych szeregach czasowych standardowe założenia zwykłej regresji mogą być naruszone, przez co typowe testy istotności i R² przestają mieć zwykłą interpretację. Wynik może wyglądać „naukowo” dokładnie dlatego, że model nie uwzględnił struktury czasu.
Dlaczego samo „korelacja nie oznacza przyczynowości” to za mało
To popularne ostrzeżenie jest prawdziwe, lecz nie wyjaśnia mechanizmu. W regresji pozornej problem pojawia się wcześniej: sama miara związku może być sztucznie wysoka z powodu wspólnej dynamiki, a nie dlatego, że znaleźliśmy dwa skorelowane skutki trzeciej zmiennej. Innymi słowy, nawet opisowa siła zależności może być artefaktem modelowania.
Co robi się z szeregami czasowymi
Analitycy sprawdzają stacjonarność, modelują trend, sezonowość i autokorelację, czasem analizują przyrosty zamiast poziomów. Gdy dwie niestacjonarne serie mają szczególną wspólną relację długookresową, możliwa jest kointegracja — ale to osobne twierdzenie wymagające testów, a nie usprawiedliwienie dla każdej korelacji trendów. Kluczowe jest respektowanie faktu, że obserwacje w czasie nie są wymienne.
Dlaczego internet kocha takie zależności
Łatwo znaleźć pary rosnących lub spadających danych: wydatki, populacje, ceny, liczba użytkowników, produkcja, emisje, liczba publikacji. Przy setkach serii można dobrać dwie, które wyglądają niemal idealnie razem. Bez teorii i analizy procesu czasowego taki wykres jest przede wszystkim demonstracją tego, jak bogata jest przestrzeń możliwych dopasowań.
Praktyczna lekcja
Gdy wykres pokazuje dwie linie zmieniające się w czasie, warto zapytać nie tylko „jak wysoka jest korelacja?”, ale też „co stanie się po usunięciu trendu?”, „czy reszty są zależne w czasie?”, „czy związek istnieje także w zmianach rok do roku?” i „jaki mechanizm miałby łączyć te procesy?”. W statystyce czas nie jest zwykłą kolumną — często zmienia cały model prawdopodobieństwa.
Dlaczego trend potrafi „wyprodukować” dopasowanie
Jeżeli dwa szeregi czasowe mają własną trwałą tendencję wzrostową albo spadkową, zwykła regresja poziomu jednego na poziom drugiego może uznać wspólny ruch w czasie za wzajemną zależność. Problem jest szczególnie poważny dla procesów niestacjonarnych, w których średnia lub inne własności zmieniają się w czasie. Dlatego w analizie szeregów czasowych często bada się zmiany, różnice, składnik trendu, autokorelację albo relacje długookresowe zamiast bezrefleksyjnie korelować dwa surowe wykresy. Ważna jest tu lekcja szersza niż samo hasło o przyczynowości: nawet jako opis współzmienności współczynnik korelacji może być mylący, jeśli model ignoruje strukturę czasową danych. Czas nie jest wtedy neutralną osią — jest wspólnym źródłem uporządkowania obu serii.