Brakujące dane mogą znikać właśnie dlatego, że mają określoną wartość
Nie wszystkie braki danych są równoważne. W klasycznej taksonomii rozróżnia się m.in. MCAR, MAR i MNAR. Najtrudniejszy przypadek, Missing Not At Random, występuje wtedy, gdy prawdopodobieństwo braku zależy od wartości, której nie obserwujemy, nawet po uwzględnieniu dostępnych informacji. Przykładowo osoby z najbardziej skrajnym wynikiem mogą być najmniej skłonne go ujawnić. Wtedy analiza samych obserwowanych przypadków może być systematycznie przesunięta, a brakujących wartości nie da się wiarygodnie „odtworzyć” bez dodatkowych, często niesprawdzalnych założeń.
Puste pole też ma mechanizm
W arkuszu danych brak bywa reprezentowany przez pustą komórkę, ale statystycznie ważne jest, dlaczego komórka jest pusta. Jeśli awaria losowo usunęła część formularzy, sytuacja jest inna niż wtedy, gdy ludzie z określonym wynikiem częściej odmawiają odpowiedzi. Ten mechanizm decyduje o tym, które metody są wiarygodne.
MCAR, MAR i MNAR
W uproszczeniu MCAR oznacza, że brak nie zależy od analizowanych wartości. MAR pozwala, by brak zależał od zmiennych obserwowanych, ale po ich uwzględnieniu nie od samej brakującej wartości. MNAR dopuszcza zależność od nieobserwowanej wartości. Nazwa MAR bywa myląca: „missing at random” nie oznacza, że brak pojawia się całkowicie przypadkowo; może być systematycznie przewidywany przez to, co już widzimy.
Dlaczego MNAR jest szczególnie trudne
Jeżeli prawdopodobieństwo braku zależy od samego brakującego wyniku, obserwowane dane nie zawierają pełnej informacji potrzebnej do oszacowania tej zależności. Dwa różne modele procesu braków mogą prowadzić do podobnych danych obserwowanych, lecz innych wniosków o tym, czego nie widzimy. Z tego powodu literatura o MNAR podkreśla rolę założeń identyfikujących i analiz wrażliwości.
Przykład intuicyjny
Wyobraź sobie anonimową ankietę o bardzo wrażliwej wartości liczbowej. Jeśli osoby z najwyższymi wartościami częściej pomijają pytanie właśnie z powodu tej wartości, średnia wśród odpowiedzi będzie zaniżona. Wiedza o wieku czy regionie może pomóc, ale jeśli po ich uwzględnieniu decyzja o odpowiedzi nadal zależy od nieujawnionego wyniku, mamy element MNAR.
Dlaczego proste usuwanie wierszy jest ryzykowne
Analiza complete cases traktuje przypadki z brakami jak nieistniejące. Może to tracić dużo informacji, a przy selektywnych brakach także tworzyć bias. Imputacja również nie jest automatycznym lekarstwem: generuje wartości zgodnie z modelem i jego założeniami. Jeśli model zakłada MAR, a rzeczywistość jest silnie MNAR, wynik może wyglądać precyzyjnie, lecz opierać się na niewłaściwym mechanizmie.
Co robi dobry analityk
Najpierw opisuje wzór braków i proces zbierania danych, następnie formułuje założenia i sprawdza, jak wnioski zmieniają się pod alternatywnymi scenariuszami. W sytuacji MNAR analiza wrażliwości jest często ważniejsza niż wybór „najlepszego” algorytmu imputacji. Brak danych nie jest technicznym bałaganem do posprzątania po analizie — bywa integralną częścią zjawiska, które próbujemy zrozumieć.
Dlaczego nie istnieje jedna uniwersalna metoda naprawy braków
Techniki takie jak imputacja wielokrotna potrafią być bardzo użyteczne, ale ich poprawność zależy od założeń o mechanizmie braków i modelu danych. Przy MAR zakłada się w uproszczeniu, że po uwzględnieniu obserwowanych zmiennych brak nie zależy już od nieobserwowanej wartości. Przy MNAR ta zależność może pozostać nawet po wykorzystaniu dostępnych informacji, więc same zaobserwowane dane nie muszą wystarczyć do jednoznacznego odtworzenia tego, czego brakuje. Dlatego analitycy wykonują analizy wrażliwości: sprawdzają, jak wnioski zmieniają się przy różnych rozsądnych założeniach dotyczących nieobserwowanych wartości. Najważniejszy wniosek jest metodologiczny — brakujące dane nie są po prostu dziurami do wypełnienia, lecz częścią procesu, który również trzeba modelować.