Che cosa fa davvero la dopamina
Non è la sostanza del piacere. I neuroni dopaminergici scaricano quando le cose vanno meglio del previsto, e tacciono quando una ricompensa arriva esattamente come annunciato.
Il segnale della sorpresa, non del piacere
Livello Base — linguaggio semplice, senza matematica
La dopamina viene descritta come la sostanza del piacere del cervello, e quella descrizione è sbagliata in un modo che conta. L'esperimento che ha chiuso la questione è abbastanza semplice da farsi in un pomeriggio. Dai a una scimmia assetata una goccia di succo senza preavviso, e i neuroni dopaminergici scaricano una raffica. Fin qui la storia del piacere regge.
Adesso fallo cento volte, ma accendi una lampadina due secondi prima di ogni goccia. Succede una cosa strana. La raffica al succo diventa sempre più piccola finché non sparisce del tutto, e ne compare una nuova alla lampadina. Alla scimmia il succo piace ancora. Lo beve con lo stesso entusiasmo. Ma i neuroni hanno smesso di reagirci.
Quello che stanno riportando non è quanto una cosa sia buona. È quanto sia migliore del previsto. Una goccia inattesa è una sorpresa piacevole, quindi c'è una raffica. Una goccia che avevi visto arrivare due secondi prima è esattamente quello che avevi previsto, quindi non c'è niente da riportare. La lampadina, invece, è informazione davvero nuova - vuol dire che sta arrivando del succo - ed è lei a prendersi la raffica adesso.
La prova sta in quello che succede quando rompi la promessa. Accendi la lampadina e poi non dare succo, e nell'istante esatto in cui la goccia sarebbe dovuta arrivare i neuroni scendono sotto il loro ritmo normale. Non è successo niente di brutto: semplicemente qualcosa di bello non è successo. Premi il pulsante nella simulazione e guarda comparire l'avvallamento.
Da sapere
- Le scimmie degli esperimenti di Wolfram Schultz bevevano il succo con lo stesso entusiasmo dopo che la risposta dopaminergica al succo era sparita del tutto. Che una cosa piaccia e che venga segnalata sono due cose diverse.
- Una ricompensa attesa che non arriva spinge la dopamina sotto la linea di base esattamente nel momento in cui era dovuta, il che significa che il cervello sta cronometrando la previsione, non solo facendola.
- Le ricompense imprevedibili tengono viva la raffica per sempre, perché non vengono mai previste del tutto. È il meccanismo attorno a cui è costruita una slot machine.
Errore di previsione della ricompensa e apprendimento per differenze temporali
Livello Studente — le equazioni principali
La quantità che i neuroni dopaminergici codificano ha una definizione precisa presa in prestito dall'apprendimento per rinforzo: l'errore di previsione della ricompensa, \(\delta = r - V\), dove \(r\) è ciò che è arrivato e \(V\) ciò che era previsto. Un \(\delta\) positivo significa meglio del previsto e produce una raffica; zero non produce niente; negativo produce una pausa sotto la linea di base. L'apprendimento è poi semplicemente \(V \leftarrow V + \alpha\delta\): sposta la previsione verso la realtà di una frazione dell'errore. È la regola di Rescorla-Wagner, proposta nel 1972 a partire da dati sull'apprendimento animale, e i neuroni dopaminergici sembrano implementarla.
La struttura temporale richiede la versione completa. Nell'apprendimento per differenze temporali l'errore è \(\delta_t = r_t + \gamma V(s_{t+1}) - V(s_t)\): uno stato ha valore se porta a stati di valore. È questo che fa migrare all'indietro nel tempo la risposta verso il primo predittore affidabile, esattamente come si osserva, e spiega l'avvallamento all'omissione della ricompensa senza assunzioni aggiuntive: \(V(s_{t+1})\) crolla a zero quando la ricompensa attesa non compare.
La corrispondenza è insolitamente stretta per le neuroscienze. L'apprendimento TD è stato sviluppato come soluzione computazionale a un problema di assegnazione del merito, e la coincidenza con la scarica dopaminergica è stata notata dopo: una previsione, non un adattamento. La dopamina agisce anche come segnale di plasticità e non solo come resoconto: apre la porta al potenziamento a lungo termine nelle sinapsi cortico-striatali, quindi il segnale di errore modifica direttamente i pesi che hanno prodotto la previsione.
La distinzione che ne segue è fra volere e gradire, ed è sperimentalmente netta. I ratti privati di dopamina mostrano ancora normali reazioni facciali di piacere al saccarosio - il gusto gli piace eccome - ma non lavorano per averlo. La dopamina assegna salienza incentivante: rende motivanti i segnali. È per questo che la dipendenza si descrive meglio come volere patologico che come piacere eccessivo, e per cui le persone riferiscono di desiderare sostanze che non gradiscono più.
Formule chiave
| Errore di previsione | \(\delta = r - V\) | la dimensione della raffica |
|---|---|---|
| Rescorla-Wagner | \(V \leftarrow V + \alpha\,\delta\) | |
| Differenza temporale | \(\delta_t = r_t + \gamma V(s_{t+1}) - V(s_t)\) | |
| Valore di uno stato | \(V(s) = \mathbb{E}\!\left[\textstyle\sum_{k} \gamma^{k} r_{t+k}\right]\) | |
| All'omissione | \(\delta = 0 - V = -V\) | l'avvallamento sotto la linea di base |
Da sapere
- L'apprendimento TD è stato inventato per risolvere un problema di machine learning. La coincidenza con la scarica dopaminergica è stata trovata dopo: uno dei casi più puliti di una teoria computazionale che predice una misurazione biologica.
- I ratti privati di dopamina fanno ancora le stesse facce di piacere davanti allo zucchero, ma non attraversano una stanza per averlo. Volere e gradire sono separabili, e la dopamina porta il volere.
- La dopamina non si limita a riportare l'errore: apre la plasticità nelle sinapsi che hanno fatto la previsione. Il segnale e la regola di apprendimento condividono la stessa molecola.
Codifica distribuzionale, tonico contro fasico e dove il racconto semplice si rompe
Livello Esperto — profondità matematica completa
01Il resoconto canonico e le sue prove
Le registrazioni di Schultz hanno stabilito le tre firme - raffica alla ricompensa non prevista, trasferimento al primo predittore, avvallamento all'omissione - e l'optogenetica ha poi fornito la causalità: far scaricare artificialmente i neuroni dopaminergici al momento della consegna produce apprendimento come se la ricompensa fosse stata migliore di quanto sia stata, e sopprimerli produce estinzione. Il segnale scala anche con probabilità e magnitudine nel modo che \(\delta\) richiede, e mostra l'asimmetria corretta, dato che le frequenze di scarica hanno un pavimento a zero mentre le raffiche no: gli errori negativi sono codificati dalla durata della pausa invece che dalla frequenza.
02Apprendimento per rinforzo distribuzionale
Il risultato recente più interessante è che la popolazione non codifica un singolo scalare. I singoli neuroni dopaminergici hanno punti di inversione diversi - la magnitudine di ricompensa alla quale passano da eccitazione a inibizione - e differiscono sistematicamente in quanto asimmetricamente pesino errori positivi e negativi. È esattamente la struttura richiesta dall'apprendimento per rinforzo distribuzionale, in cui una popolazione di predittori di valore con parametri di ottimismo diversi rappresenta collettivamente l'intera distribuzione di probabilità sulla ricompensa futura invece della sua media. La distribuzione si può decodificare dalla popolazione, il che significa che il cervello sta seguendo il rischio, non solo l'aspettativa.
03Tonico, fasico e vigore
Le raffiche fasiche su scala di centinaia di millisecondi portano l'errore di previsione; la concentrazione tonica, che varia lentamente, sembra portare qualcos'altro. Il resoconto di Niv lega la dopamina tonica al tasso medio di ricompensa, che nel controllo ottimo fissa il costo opportunità del tempo e quindi il vigore ottimale, cioè quanto in fretta agire. Spiega l'accoppiamento altrimenti curioso fra bradicinesia nella malattia di Parkinson e capacità motoria intatta, e l'effetto degli stimolanti sulla velocità di risposta più che sull'accuratezza. Spiega anche perché la stessa molecola sembri un segnale di apprendimento in un esperimento e un segnale motorio in un altro: scale temporali diverse, quantità diverse.
04Dove il racconto semplice è sbagliato
I neuroni dopaminergici non sono omogenei. Una sottopopolazione sostanziale, in particolare nell'area tegmentale ventrale che proietta alla coda dello striato, risponde a eventi salienti compresi quelli avversivi e a stimoli neutri nuovi, il che non è un errore di previsione della ricompensa sotto nessuna lettura. Il rilascio dopaminergico nello striato dorsale segue posizione e cinematica del movimento in modi che uno scalare di errore non può spiegare, e lavori recenti mostrano onde di rilascio che attraversano lo striato con struttura spaziale. Il campo sta convergendo su una visione in cui è il bersaglio della proiezione, non l'identità della cellula, a determinare che cosa significhi il segnale.
05Dipendenza, e che cosa la dopamina predice davvero
Il modello di Redish tratta le droghe che danno dipendenza come produttrici di un errore di previsione che l'apprendimento non può cancellare, perché la droga agisce farmacologicamente sul segnale di errore invece che attraverso la via della ricompensa di cui la previsione imparerebbe. Il valore degli stati che predicono la droga cresce quindi senza limite, il che corrisponde al quadro clinico meglio di qualsiasi resoconto basato sul piacere: la tolleranza riduce l'effetto edonico mentre il desiderio aumenta, e le ricadute innescate dagli stimoli avvengono molto dopo la fine dell'astinenza. L'implicazione pratica è che il bersaglio del trattamento è l'associazione fra segnale e valore, non il piacere.
Formule chiave
| Errore TD | \(\delta_t = r_t + \gamma V(s_{t+1}) - V(s_t)\) | |
|---|---|---|
| Aggiornamento asimmetrico | \(V_i \leftarrow V_i + \alpha_i^{+}[\delta]_{+} - \alpha_i^{-}[\delta]_{-}\) | |
| Expectile | \(\tau_i = \dfrac{\alpha_i^{+}}{\alpha_i^{+}+\alpha_i^{-}}\) | l'ottimismo del neurone |
| Ricompensa media | \(\rho = \lim_{T\to\infty}\tfrac{1}{T}\textstyle\sum_{t} r_t\) | dopamina tonica, vigore |
| Vigore ottimo | \(\tau^{*} = \sqrt{C_v/\rho}\) | agisci più in fretta quando la ricompensa è fitta |
Da sapere
- I singoli neuroni dopaminergici hanno punti di inversione diversi e ottimismo diverso: esattamente la struttura richiesta dall'apprendimento per rinforzo distribuzionale. La distribuzione sulla ricompensa futura si può decodificare dalla popolazione.
- La dopamina tonica sembra fissare il vigore codificando il tasso medio di ricompensa, che nel controllo ottimo è il costo opportunità del tempo. Spiega perché la lentezza parkinsoniana convive con una capacità motoria intatta.
- Le droghe che danno dipendenza producono un errore di previsione che il sistema non riesce a cancellare imparando, perché agiscono sul segnale di errore stesso. Il valore cresce senza limite: è desiderio senza godimento.