Słowniczek · Psychologia

Błąd predykcji nagrody (Reward Prediction Error)

Błąd predykcji nagrody (reward prediction error, RPE) to różnica między nagrodą, którą faktycznie otrzymujesz, a tą, której Twój układ nagrody się spodziewał. Wbrew potocznemu wyobrażeniu neurony dopaminowe nie kodują przyjemności. Kodują właśnie tę różnicę i to ona jest sygnałem, na podstawie którego mózg aktualizuje swoje przewidywania.

Trzy możliwe wartości

  • Dodatnia – nagroda okazała się większa lub bardziej zaskakująca niż oczekiwana. Zachowanie, które ją poprzedziło, zostaje wzmocnione.
  • Zerowa – nagroda dokładnie taka, jakiej się spodziewałeś. Nic nowego się nie uczysz, bo nie ma czego korygować.
  • Ujemna – nagroda mniejsza od oczekiwanej albo jej brak. Aktywność neuronów spada poniżej poziomu spoczynkowego, a zachowanie zostaje osłabione.

Dlaczego to jest mechanizm nawyku

W klasycznych badaniach Wolframa Schultza reakcja dopaminowa u zwierząt, które nauczyły się, że po dźwięku przychodzi jedzenie, stopniowo zanikała przy samym jedzeniu i pojawiała się przy dźwięku. Sygnał cofa się w czasie do bodźca. To dokładnie ten mechanizm sprawia, że widok butów biegowych zaczyna ciągnąć do biegania, zanim jeszcze cokolwiek zrobisz.

Praktyczna konsekwencja jest niewygodna dla popularnych poradników o nawykach: jeśli nagroda przychodzi po tygodniach i jest rozmyta w setce innych zmiennych, błąd predykcji jest bliski zeru, a samo powtarzanie zachowania niczego nie utrwala. Dlatego skuteczniejsze bywa wstawienie odczuwalnej nagrody do środka czynności niż czekanie na efekt odległy w czasie.

Gdzie to widać poza laboratorium

Na tym samym mechanizmie stoją zmienne harmonogramy nagradzania w aplikacjach i grach: nagroda nieprzewidywalna generuje większy błąd predykcji niż nagroda pewna, więc silniej wzmacnia zachowanie. To także jeden z powodów, dla których osoby z ADHD wyraźniej preferują nagrody natychmiastowe, bo odroczona obietnica ma dla ich układu nagrody mniejszą siłę.

Pytania i odpowiedzi

Najczęściej zadawane pytania

Nie. Przyjemność jest odczuciem, a błąd predykcji nagrody jest sygnałem uczenia się: różnicą między nagrodą otrzymaną a przewidywaną. Można odczuwać przyjemność przy zerowym błędzie predykcji, jeśli nagroda była w pełni oczekiwana. Wtedy mózg nie ma czego korygować i zachowanie nie zostaje dodatkowo wzmocnione.

Bo błąd predykcji spada do zera. Kiedy układ nagrody trafnie przewiduje, co dostanie, nie ma rozbieżności do skorygowania i nie ma sygnału uczenia. Zachowanie nadal może być wykonywane, ale przestaje się wzmacniać. Dlatego nagrody zmienne i nieregularne mają silniejszy wpływ na utrwalanie zachowań niż nagrody stałe.

Nawyk powstaje wtedy, gdy reakcja mózgu przesuwa się z nagrody na bodziec, który ją zapowiada. To przesunięcie napędza właśnie błąd predykcji. Jeśli nagroda jest odroczona o tygodnie albo tak mała, że nie tworzy żadnej rozbieżności, przesunięcie nie zachodzi i zachowanie na zawsze zostaje w trybie świadomej decyzji.

Powiązane pojęcia

Powiązane artykuły