Uczenie się, nawyki i nagroda

Badacze rozpoznają nawyk, sprawdzając, co stanie się po obniżeniu wartości nagrody

Jeżeli działanie wykonujemy dlatego, że prowadzi do pożądanego wyniku, powinno ono osłabnąć, gdy ten wynik straci wartość. Na tej zasadzie działa outcome devaluation, jeden z klasycznych testów kontroli celowej i nawykowej. W badaniach zwierzęcych procedura jest bardzo wpływowa. U ludzi okazuje się jednak metodologicznie trudniejsza: trzeba upewnić się, że nagroda faktycznie została zzdewaluowana i że uczestnik ma możliwość wykorzystania tej informacji podczas testu. Najważniejsze jest to, że nawyk eksperymentalny rozpoznaje się po względnej niewrażliwości na zmianę wartości wyniku, ale u ludzi trzeba najpierw wykazać, że sama dewaluacja rzeczywiście zadziałała.

Bodziec długo pozbawiony znaczenia może później uczyć się wolniej — ale u ludzi efekt jest trudniejszy do uchwycenia

W badaniach zwierzęcych wielokrotna ekspozycja na neutralny bodziec bez żadnych konsekwencji może opóźnić późniejsze nauczenie się, że ten sam bodziec zapowiada ważny wynik. Zjawisko nazywa się latent inhibition. Intuicyjnie środowisko „nauczyło”, że sygnał jest nieistotny. U ludzi sprawa jest jednak znacznie mniej czysta: wyniki silnie zależą od procedury, instrukcji i zadań maskujących, dlatego nie należy bez zastrzeżeń przenosić prostego efektu zwierzęcego na ludzkie zachowanie. Najważniejsze jest to, że preekspozycja na nieistotny bodziec może utrudnić późniejsze uczenie jego nowego znaczenia, ale czyste wykazanie tego efektu u ludzi jest metodologicznie trudne.

Brak oczekiwanej nagrody jest sygnałem uczenia, a nie „brakiem danych”

Jeżeli organizm nauczył się dokładnie, kiedy ma nadejść nagroda, jej pominięcie tworzy konkretną informację: rzeczywistość jest gorsza od przewidywania. W klasycznych zapisach aktywności neuronów dopaminowych widoczna jest wtedy pauza lub spadek w momencie, w którym nagroda powinna się pojawić. To ujemny reward prediction error. System uczy się więc także z nieobecności oczekiwanego zdarzenia — ale tylko wtedy, gdy istniało wystarczająco precyzyjne oczekiwanie, które mogło zostać naruszone. Najważniejsze jest to, że kiedy nagroda jest precyzyjnie oczekiwana, jej brak tworzy ujemny błąd przewidywania, który pomaga aktualizować przyszłe oczekiwania.

Cel i nawyk mogą sterować tym samym zachowaniem jednocześnie

Popularne opisy sugerują przełącznik: najpierw działamy celowo, potem „włącza się nawyk”. Współczesne modele są mniej binarne. Kontrola oparta na przewidywanych konsekwencjach i kontrola oparta na wyuczonych tendencjach mogą działać równolegle, a ich względny wpływ zmienia się zależnie od czasu, kontekstu, trudności i dostępnych zasobów. Podobnie modele model-based i model-free z reinforcement learning opisują częściowo odmienne strategie obliczeniowe, ale nie są idealnymi synonimami psychologicznych pojęć działania celowego i nawyku.

Dopamina nie jest po prostu „substancją przyjemności”

Dopaminę często opisuje się jako chemiczny odpowiednik przyjemności, ale taki skrót miesza kilka różnych procesów. Układy dopaminowe uczestniczą w uczeniu się o nagrodach, motywacyjnym „wanting”, wyborze i sygnałach błędu przewidywania. Tymczasem hedoniczne „liking” — sam przyjemny wpływ nagrody — ma częściowo odmienne mechanizmy. Manipulacje dopaminą mogą silnie zmieniać dążenie do nagrody bez proporcjonalnej zmiany reakcji hedonicznych. To dlatego „więcej dopaminy = więcej przyjemności” jest naukowo zbyt prostą opowieścią.

Gdy reguły nagrody się odwracają, trzeba zaktualizować nie tylko wybór, ale cały model sytuacji

W reversal learning organizm najpierw uczy się, że jedna opcja jest lepsza od drugiej, a potem eksperymentator odwraca zależność. Dawniej takie zadania traktowano głównie jako test hamowania starej reakcji. Współczesne ujęcia są bogatsze: trzeba wykryć zmianę reguły, aktualizować oczekiwania dotyczące wyników i zdecydować, kiedy kilka porażek oznacza prawdziwe odwrócenie, a kiedy jedynie przypadkowy brak nagrody. Najważniejsze jest to, że odwrócenie reguł wymaga nie tylko zahamowania starej reakcji, ale również wykrycia, że zmieniła się struktura zależności między wyborem a wynikiem.

Możemy połączyć dwa neutralne bodźce, zanim którykolwiek z nich zacznie cokolwiek znaczyć

W sensory preconditioning organizm najpierw doświadcza dwóch neutralnych bodźców razem. Dopiero później jeden z nich zostaje skojarzony z ważnym wynikiem. Mimo że drugi nigdy nie był bezpośrednio łączony z nagrodą czy zagrożeniem, może później wywoływać reakcję. Oznacza to, że system uczenia potrafi budować relacje między pozornie nieistotnymi zdarzeniami i wykorzystać je dopiero wtedy, gdy część tej sieci nabierze znaczenia. Najważniejsze jest to, że neutralne doświadczenia mogą tworzyć relacje, które nabierają znaczenia dopiero później; uczenie nie zawsze wymaga natychmiastowej nagrody lub kary.

Można bardzo silnie czegoś chcieć, nie czerpiąc z tego równie dużej przyjemności

Nagroda nie jest jednym procesem psychicznym. Badacze rozdzielają co najmniej „liking” — hedoniczny wpływ otrzymanego bodźca, „wanting” — motywacyjną siłę popychającą do jego zdobycia, oraz uczenie o tym, kiedy i gdzie się pojawia. Mechanizmy te zwykle współpracują, dlatego subiektywnie zlewają się w jedno. Eksperymenty pokazują jednak, że można zmienić dążenie do nagrody bez proporcjonalnej zmiany reakcji przyjemności. To ważny kontrargument wobec intuicji, że silniejsze pragnienie zawsze oznacza silniejsze lubienie.

Można nauczyć się sygnału oznaczającego, że spodziewane zdarzenie tym razem nie nastąpi

Warunkowanie nie polega wyłącznie na uczeniu się, że „po X wydarzy się Y”. W conditioned inhibition bodziec może nabyć przeciwne znaczenie: zapowiadać brak wyniku, który w danym kontekście byłby normalnie oczekiwany. Taki sygnał nie jest po prostu neutralny. W odpowiednich testach potrafi osłabiać reakcję wywoływaną przez sygnał zagrożenia lub nagrody, a później wolniej nabywać znaczenie przeciwne. Najważniejsze jest to, że organizm może nauczyć się nie tylko, co zapowiada wynik, lecz także który sygnał wiarygodnie zapowiada jego brak.

Nagroda po działaniu nie wystarcza — organizm może uczyć się, czy działanie naprawdę zwiększa jej szansę

W uczeniu instrumentalnym ważna jest nie tylko kolejność „zrobiłem coś, potem dostałem nagrodę”. Liczy się contingency, czyli to, czy wykonanie działania rzeczywiście zmienia prawdopodobieństwo wyniku. Jeżeli nagroda zaczyna pojawiać się równie często bez działania, zachowanie może osłabnąć mimo że nagrody nadal istnieją. Organizm śledzi więc przyczynową strukturę własnego działania dokładniej, niż sugeruje prosty schemat „nagroda wzmacnia wszystko, co było tuż przed nią”. Najważniejsze jest to, że zachowanie celowe zależy od tego, czy działanie naprawdę zmienia szansę wyniku, a nie tylko od tego, czy nagroda czasem pojawia się chwilę później.

Nawyk może być silny właśnie dlatego, że jest związany z określonym kontekstem

Nawyki często przedstawia się jako zachowania odporne na sytuację, które „po prostu robimy”. Badania sugerują jednak, że ich siła może wynikać z odwrotnej cechy: reakcja została wielokrotnie połączona z konkretnymi wskazówkami otoczenia. Gdy kontekst się zmienia, automatyczne uruchamianie może osłabnąć, a kontrola celowa zyskać większy wpływ. Nawyki są więc nie tyle pozbawione kontekstu, co często przez niego bardzo precyzyjnie wyzwalane. Najważniejsze jest to, że nawyk często działa dzięki stabilnym wskazówkom kontekstowym; zmiana tych wskazówek może ograniczyć jego automatyczne uruchamianie.

Nawyk nie jest po prostu czynnością, którą wykonujemy bardzo często

Codzienny język nazywa nawykiem niemal wszystko, co się powtarza. W psychologii uczenia pojęcie jest bardziej precyzyjne: nawyk wiąże się z automatycznym uruchamianiem reakcji przez wyuczone wskazówki kontekstowe i ze zmniejszoną zależnością od bieżącej oceny celu. Częstotliwość pomaga w tworzeniu takich relacji, ale sama nie wystarcza do wykazania nawyku. Można często wykonywać działanie, które za każdym razem pozostaje elastycznie sterowane oczekiwanym wynikiem. Najważniejsze jest to, że częste zachowanie może być nawykowe, ale sama częstotliwość tego nie dowodzi; kluczowe jest to, co steruje reakcją.

Nie istnieje psychologiczna granica „21 dni”, po której zachowanie nagle staje się nawykiem

Słynna reguła 21 dni nie opisuje wyniku badań nad formowaniem nawyków. W klasycznym badaniu terenowym uczestnicy przez 12 tygodni powtarzali wybraną czynność w stałym kontekście, a wzrost deklarowanej automatyczności miał kształt stopniowo spłaszczającej się krzywej. Czas dojścia do 95% indywidualnego plateau wynosił od 18 do 254 dni wśród osób, dla których model dobrze pasował. Średnia około 66 dni stała się popularna, ale również nie jest uniwersalną receptą. Najważniejsze jest to, że formowanie automatyczności jest stopniowe i bardzo zróżnicowane; ani 21, ani 66 dni nie jest uniwersalnym terminem powstania nawyku.

Nieregularnie nagradzane zachowanie może dłużej utrzymywać się po zniknięciu nagrody

Jeżeli reakcja była wzmacniana tylko podczas części prób, po całkowitym usunięciu nagrody może zanikać wolniej niż reakcja wcześniej nagradzana za każdym razem. To tzw. efekt częściowego wzmocnienia podczas wygaszania. Nie oznacza jednak prostej zasady, że każda losowa nagroda automatycznie tworzy „silniejszy nawyk”. Efekt zależy od procedury, a badacze od dekad spierają się o mechanizmy, które go powodują. Najważniejsze jest to, że brak nagrody jest mniej informacyjny, jeśli podczas nauki brak nagrody zdarzał się już często; dlatego wygaszanie może przebiegać wolniej.

Nowy sygnał może prawie niczego nas nie nauczyć, jeśli stary sygnał już doskonale przewiduje wynik

W efekcie blocking dwa bodźce mogą wielokrotnie pojawiać się razem przed ważnym wynikiem, a mimo to jeden z nich zostanie słabo wyuczony. Dzieje się tak, gdy drugi bodziec już wcześniej dobrze przewidywał to zdarzenie. Nowy sygnał nie wnosi wtedy wiele zaskoczenia ani informacji. To klasyczny argument przeciw prostej wizji uczenia jako mechanicznego zapisywania wszystkiego, co często występuje razem. Najważniejsze jest to, że nie uczymy się równie mocno wszystkich współwystępujących sygnałów; nowa wskazówka może zostać „zablokowana”, jeśli nie poprawia już przewidywania wyniku.

Przy tworzeniu nawyku uczymy się nie tylko zachowania, ale także sygnału, który ma je uruchamiać

Powtarzanie czynności w stałym kontekście sprawia, że elementy sytuacji coraz silniej kojarzą się z reakcją. Z czasem samo pojawienie się wskazówki — miejsca, poprzedzającej czynności czy pory — może zwiększać gotowość do wykonania zachowania. To dlatego dwa identyczne zestawy powtórzeń nie muszą tworzyć równie silnej automatyczności, jeśli jeden odbywa się w przewidywalnym kontekście, a drugi za każdym razem w całkiem innych warunkach. Najważniejsze jest to, że nawyk powstaje przez wzmacnianie relacji między kontekstem a reakcją; samo liczenie powtórzeń pomija to, co później ma uruchamiać zachowanie.

Samo „przeuczenie” nie zamienia u ludzi niezawodnie działania celowego w nawyk

Klasyczne badania na zwierzętach pokazały, że rozbudowany trening może przesuwać kontrolę od działania wrażliwego na wartość wyniku ku bardziej habitualnej reakcji. W psychologii człowieka ten prosty schemat okazał się jednak trudny do odtworzenia. Seria eksperymentów z wydłużonym treningiem nie wykazała oczekiwanego wzrostu niewrażliwości na dewaluację. Nowsze prace nadal rozwijają lepsze procedury. Wniosek nie brzmi „ludzie nie mają nawyków”, lecz „liczba powtórzeń sama nie jest wystarczającym laboratoryjnym dowodem przejścia do kontroli nawykowej”.

Samo ponowne zetknięcie z dawnym wynikiem może przywrócić wygaszoną reakcję

Po wygaszeniu wyuczonej reakcji nie trzeba ponownie łączyć bodźca z nagrodą albo zagrożeniem, aby odpowiedź częściowo wróciła. W reinstatement wystarczy późniejsze doświadczenie samego ważnego wyniku, a następnie ponowny test dawnego bodźca. Efekt jest kolejnym dowodem, że pierwotne skojarzenie przetrwało wygaszanie. Znaczenie ma jednak kontekst: doświadczenie wyniku może odnowić oczekiwanie, że w danej sytuacji ważne zdarzenia znów są prawdopodobne. Najważniejsze jest to, że wygaszona reakcja może wrócić po ponownym doświadczeniu samego wyniku, nawet bez ponownego łączenia go z dawnym bodźcem.

Stare zachowanie może wrócić, gdy przestaje działać jego nowszy zamiennik

Wyobraź sobie, że reakcja A kiedyś dawała nagrodę, potem została wygaszona, a w jej miejsce nauczyłeś się reakcji B. Jeśli później także B przestaje być nagradzana, A może niespodziewanie wrócić. To zjawisko nazywa się resurgence. Nie wymaga ponownego wzmacniania starej reakcji. Pokazuje, że wcześniejsze zachowania pozostają częścią repertuaru i mogą odzyskać kontrolę, gdy aktualna strategia przestaje działać. Najważniejsze jest to, że zastąpienie starego zachowania nowym nie musi usuwać pierwszego; gdy nowa strategia przestaje działać, stara może wrócić.

Sygnał nagrody może zwiększyć wysiłek w działaniu, którego nigdy bezpośrednio z tym sygnałem nie uczono

W Pavlovian–instrumental transfer najpierw osobno uczymy się, że pewien bodziec zapowiada nagrodę, oraz że określone działanie może przynosić nagrodę. Podczas testu sam bodziec potrafi zwiększyć siłę lub częstość działania, mimo że nigdy nie był formalnie wymagany do jego wykonania. To pokazuje, że warunkowanie Pawłowowskie i instrumentalne nie działają jak dwa zamknięte systemy: wyuczone wskazówki mogą przelewać motywację na działania nabyte inną drogą. Najważniejsze jest to, że wyuczony sygnał nagrody może podbić wykonanie niezależnie wyuczonego działania — motywacyjne skutki warunkowania przenoszą się między systemami uczenia.

Ta sama nagroda może silnie pobudzić sygnał uczenia albo prawie go nie zmienić — zależnie od oczekiwania

W klasycznych badaniach neuronów dopaminowych niespodziewana nagroda wywołuje silną krótką odpowiedź. Kiedy zwierzę nauczy się, że wcześniejszy bodziec niezawodnie ją zapowiada, reakcja na samą nagrodę słabnie, a aktywność przesuwa się na sygnał przewidujący. Nie oznacza to, że nagroda przestała być wartościowa. Zmniejszył się błąd przewidywania: wynik nie wnosi już nowej informacji. To fundamentalna różnica między wartością nagrody a sygnałem, który mówi „musisz zaktualizować oczekiwanie”. Najważniejsze jest to, że dopaminowy sygnał uczenia zależy od zaskoczenia wynikiem: nagroda dobrze przewidziana może dawać znacznie mniejszy błąd przewidywania niż identyczna nagroda niespodziewana.

U ludzi reakcja może generalizować przez znaczenie, a nie tylko przez podobieństwo wyglądu

Dwa obiekty nie muszą wyglądać podobnie, aby wyuczone znaczenie jednego przeniosło się na drugi. Ludzki system uczenia korzysta również z kategorii i relacji pojęciowych. Badania warunkowania strachu pokazały generalizację między elementami związanymi znaczeniowo oraz w obrębie wyuczonych kategorii. To odróżnia część ludzkiej generalizacji od prostego „im bardziej podobny kształt, tym podobniejsza reakcja” i pokazuje, jak wiedza semantyczna wpływa na późniejsze zachowanie. Najważniejsze jest to, że ludzka generalizacja może podążać za kategorią lub znaczeniem bodźca, nawet gdy nowy obiekt nie jest do niego szczególnie podobny fizycznie.

Wygaszanie nie wymazuje tego, czego organizm wcześniej się nauczył

Gdy wyuczony bodziec przestaje zapowiadać nagrodę albo zagrożenie, reakcja może stopniowo słabną. Intuicyjnie wygląda to jak usunięcie starego skojarzenia, ale wiele wyników pokazuje coś innego: podczas wygaszania powstaje nowe uczenie, które konkuruje z wcześniejszym. Dlatego dawna reakcja może wrócić po upływie czasu, zmianie kontekstu albo ponownym zetknięciu z ważnym zdarzeniem. Wygaszanie jest więc bardziej podobne do nauczenia się „teraz ten bodziec nie ma już tego znaczenia” niż do skasowania poprzedniej pamięci.

Wygaszenie reakcji na jeden bodziec nie musi dobrze przenosić się na podobne bodźce

Organizm może nauczyć się, że konkretny sygnał nie zapowiada już zagrożenia, ale ta nowa wiedza bywa węższa niż wcześniejsza generalizacja reakcji. W badaniach wygaszania jednym z kluczowych problemów jest właśnie transfer bezpieczeństwa na inne bodźce i sytuacje. To ciekawa asymetria: wyuczony strach może rozlać się na podobne obiekty, podczas gdy wygaszanie może pozostać mocniej związane z tym, na czym było ćwiczone. Najważniejsze jest to, że nowa wiedza powstała podczas wygaszania może być bardziej specyficzna niż pierwotna reakcja, dlatego bezpieczeństwo wyuczone dla jednego bodźca nie musi automatycznie obejmować wszystkich podobnych.

Wygaszona reakcja może wrócić tylko dlatego, że minął czas

Reakcja może niemal zniknąć podczas wygaszania, a następnie częściowo powrócić po przerwie, mimo że w międzyczasie nie wydarzyło się nic, co ponownie wzmacniałoby stare skojarzenie. Zjawisko to nazywa się spontanicznym odnowieniem reakcji. Jest jednym z klasycznych dowodów, że wygaszanie nie kasuje pierwotnego uczenia. Upływ czasu zmienia względną dostępność pamięci nabycia i pamięci wygaszania, dlatego po przerwie wcześniejsza reakcja może znowu stać się widoczna. Najważniejsze jest to, że po wygaszaniu stara reakcja może częściowo powrócić po przerwie, co pokazuje, że pierwotne uczenie nie zostało po prostu skasowane.

Wyuczona reakcja może przenieść się na bodźce, których nigdy wcześniej nie trenowano

Po nauczeniu się reakcji na jeden bodziec organizm często reaguje również na bodźce do niego podobne. To generalizacja. W laboratorium można nawet zobaczyć gradient: im bardziej nowy bodziec przypomina ten wyuczony, tym silniejsza bywa reakcja. System uczenia nie tworzy więc zawsze wąskiej reguły dotyczącej jednego dokładnego obiektu. Rozszerza przewidywanie na podobne sytuacje, co bywa adaptacyjne, ale może też prowadzić do reakcji w miejscach, gdzie pierwotna zależność już nie obowiązuje. Najważniejsze jest to, że generalizacja sprawia, że doświadczenie z jednym bodźcem wpływa na reakcje wobec podobnych bodźców; dzięki temu uczenie działa poza dokładnymi kopiami sytuacji treningowej.

Wyuczony sygnał nagrody może chwilowo zwiększyć „chcenie”, nawet jeśli sama nagroda się nie zmieniła

Bodziec wielokrotnie związany z nagrodą może zyskać incentive salience — motywacyjną istotność, dzięki której przyciąga uwagę i zwiększa gotowość do działania. W odpowiednim stanie ten sam sygnał może wywołać silniejsze „wanting”, choć fizyczna nagroda i jej hedoniczne właściwości są dokładnie takie same jak wcześniej. Motywacja nie jest więc stałą etykietą przypisaną do rzeczy; może dynamicznie zależeć od wskazówek oraz aktualnego stanu organizmu. Najważniejsze jest to, że wyuczony sygnał może dynamicznie zwiększać motywacyjne „wanting” nagrody, nie czyniąc samej nagrody bardziej przyjemną.

Zmiana miejsca może przywrócić reakcję, która wcześniej została wygaszona

Jeżeli reakcja została wygaszona w jednym otoczeniu, przeniesienie testu do innego miejsca może sprawić, że częściowo wróci. Zjawisko to nazywa się renewal, czyli odnowieniem zależnym od kontekstu. Pokazuje ono, że organizm nie uczy się wyłącznie prostego zdania „bodziec już nic nie znaczy”. Informacja z fazy wygaszania jest powiązana z warunkami, w których powstała, a poza nimi starsza pamięć może odzyskać większy wpływ na zachowanie. Najważniejsze jest to, że wygaszenie może być silnie związane z kontekstem; poza nim starsze uczenie potrafi ponownie przejąć kontrolę nad reakcją.