Lab-in-a-Tab

Che cosa fa davvero la dopamina

Non è la sostanza del piacere. I neuroni dopaminergici scaricano quando le cose vanno meglio del previsto, e tacciono quando una ricompensa arriva esattamente come annunciato.

Previsione della ricompensaApprendimentoStriato
ProvaGuarda e basta per i primi venti giri e segui la linea gialla e quella blu che si incrociano: la gobba si sposta dal succo alla lampadina da sola. Poi premi Togli la ricompensa e guarda l'avvallamento esattamente dove sarebbe dovuto arrivare il succo. Infine porta Ogni quanto arriva la ricompensa a circa metà e vedi che la gobba al succo non sparisce mai del tutto.
Cosa stai vedendoUn giro alla volta, che si ripete in continuo. Si accende una lampadina, poi dopo un'attesa arriva una goccia di succo. Sotto, quello che fa la cellula dopaminergica in ogni istante: una gobba sopra il suo ritmo normale, o un avvallamento sotto. In basso, il registro di ogni giro fatto finora: la linea rosa è quello che la lampadina è arrivata a significare, la linea gialla è la gobba alla lampadina, la linea blu è la gobba al succo.
Cosa notare
La cellula non sta riportando quanto sia buono il succo. Sta riportando quanto le cose siano andate meglio del previsto. È per questo che la gobba si sposta. All'inizio il succo è una sorpresa, quindi la gobba se la prende il succo; una volta che la lampadina lo predice in modo affidabile, il succo è esattamente quello che era previsto e non resta niente da riportare, mentre la lampadina è diventata il momento in cui la notizia arriva davvero. La prova è quello che succede quando togli la ricompensa: non è successo niente di brutto, semplicemente non è successo qualcosa di bello, e la cellula scende sotto il suo ritmo normale nel secondo preciso in cui il succo era dovuto. Il che ti dice anche una cosa silenziosamente notevole: il cervello stava cronometrando la previsione, non solo facendola.

Il segnale della sorpresa, non del piacere

Livello Base — linguaggio semplice, senza matematica

La dopamina viene descritta come la sostanza del piacere del cervello, e quella descrizione è sbagliata in un modo che conta. L'esperimento che ha chiuso la questione è abbastanza semplice da farsi in un pomeriggio. Dai a una scimmia assetata una goccia di succo senza preavviso, e i neuroni dopaminergici scaricano una raffica. Fin qui la storia del piacere regge.

Adesso fallo cento volte, ma accendi una lampadina due secondi prima di ogni goccia. Succede una cosa strana. La raffica al succo diventa sempre più piccola finché non sparisce del tutto, e ne compare una nuova alla lampadina. Alla scimmia il succo piace ancora. Lo beve con lo stesso entusiasmo. Ma i neuroni hanno smesso di reagirci.

Quello che stanno riportando non è quanto una cosa sia buona. È quanto sia migliore del previsto. Una goccia inattesa è una sorpresa piacevole, quindi c'è una raffica. Una goccia che avevi visto arrivare due secondi prima è esattamente quello che avevi previsto, quindi non c'è niente da riportare. La lampadina, invece, è informazione davvero nuova - vuol dire che sta arrivando del succo - ed è lei a prendersi la raffica adesso.

La prova sta in quello che succede quando rompi la promessa. Accendi la lampadina e poi non dare succo, e nell'istante esatto in cui la goccia sarebbe dovuta arrivare i neuroni scendono sotto il loro ritmo normale. Non è successo niente di brutto: semplicemente qualcosa di bello non è successo. Premi il pulsante nella simulazione e guarda comparire l'avvallamento.

Da sapere

  • Le scimmie degli esperimenti di Wolfram Schultz bevevano il succo con lo stesso entusiasmo dopo che la risposta dopaminergica al succo era sparita del tutto. Che una cosa piaccia e che venga segnalata sono due cose diverse.
  • Una ricompensa attesa che non arriva spinge la dopamina sotto la linea di base esattamente nel momento in cui era dovuta, il che significa che il cervello sta cronometrando la previsione, non solo facendola.
  • Le ricompense imprevedibili tengono viva la raffica per sempre, perché non vengono mai previste del tutto. È il meccanismo attorno a cui è costruita una slot machine.

Errore di previsione della ricompensa e apprendimento per differenze temporali

Livello Studente — le equazioni principali

La quantità che i neuroni dopaminergici codificano ha una definizione precisa presa in prestito dall'apprendimento per rinforzo: l'errore di previsione della ricompensa, \(\delta = r - V\), dove \(r\) è ciò che è arrivato e \(V\) ciò che era previsto. Un \(\delta\) positivo significa meglio del previsto e produce una raffica; zero non produce niente; negativo produce una pausa sotto la linea di base. L'apprendimento è poi semplicemente \(V \leftarrow V + \alpha\delta\): sposta la previsione verso la realtà di una frazione dell'errore. È la regola di Rescorla-Wagner, proposta nel 1972 a partire da dati sull'apprendimento animale, e i neuroni dopaminergici sembrano implementarla.

La struttura temporale richiede la versione completa. Nell'apprendimento per differenze temporali l'errore è \(\delta_t = r_t + \gamma V(s_{t+1}) - V(s_t)\): uno stato ha valore se porta a stati di valore. È questo che fa migrare all'indietro nel tempo la risposta verso il primo predittore affidabile, esattamente come si osserva, e spiega l'avvallamento all'omissione della ricompensa senza assunzioni aggiuntive: \(V(s_{t+1})\) crolla a zero quando la ricompensa attesa non compare.

La corrispondenza è insolitamente stretta per le neuroscienze. L'apprendimento TD è stato sviluppato come soluzione computazionale a un problema di assegnazione del merito, e la coincidenza con la scarica dopaminergica è stata notata dopo: una previsione, non un adattamento. La dopamina agisce anche come segnale di plasticità e non solo come resoconto: apre la porta al potenziamento a lungo termine nelle sinapsi cortico-striatali, quindi il segnale di errore modifica direttamente i pesi che hanno prodotto la previsione.

La distinzione che ne segue è fra volere e gradire, ed è sperimentalmente netta. I ratti privati di dopamina mostrano ancora normali reazioni facciali di piacere al saccarosio - il gusto gli piace eccome - ma non lavorano per averlo. La dopamina assegna salienza incentivante: rende motivanti i segnali. È per questo che la dipendenza si descrive meglio come volere patologico che come piacere eccessivo, e per cui le persone riferiscono di desiderare sostanze che non gradiscono più.

Formule chiave

Errore di previsione\(\delta = r - V\)la dimensione della raffica
Rescorla-Wagner\(V \leftarrow V + \alpha\,\delta\)
Differenza temporale\(\delta_t = r_t + \gamma V(s_{t+1}) - V(s_t)\)
Valore di uno stato\(V(s) = \mathbb{E}\!\left[\textstyle\sum_{k} \gamma^{k} r_{t+k}\right]\)
All'omissione\(\delta = 0 - V = -V\)l'avvallamento sotto la linea di base

Da sapere

  • L'apprendimento TD è stato inventato per risolvere un problema di machine learning. La coincidenza con la scarica dopaminergica è stata trovata dopo: uno dei casi più puliti di una teoria computazionale che predice una misurazione biologica.
  • I ratti privati di dopamina fanno ancora le stesse facce di piacere davanti allo zucchero, ma non attraversano una stanza per averlo. Volere e gradire sono separabili, e la dopamina porta il volere.
  • La dopamina non si limita a riportare l'errore: apre la plasticità nelle sinapsi che hanno fatto la previsione. Il segnale e la regola di apprendimento condividono la stessa molecola.

Codifica distribuzionale, tonico contro fasico e dove il racconto semplice si rompe

Livello Esperto — profondità matematica completa

01Il resoconto canonico e le sue prove

Le registrazioni di Schultz hanno stabilito le tre firme - raffica alla ricompensa non prevista, trasferimento al primo predittore, avvallamento all'omissione - e l'optogenetica ha poi fornito la causalità: far scaricare artificialmente i neuroni dopaminergici al momento della consegna produce apprendimento come se la ricompensa fosse stata migliore di quanto sia stata, e sopprimerli produce estinzione. Il segnale scala anche con probabilità e magnitudine nel modo che \(\delta\) richiede, e mostra l'asimmetria corretta, dato che le frequenze di scarica hanno un pavimento a zero mentre le raffiche no: gli errori negativi sono codificati dalla durata della pausa invece che dalla frequenza.

02Apprendimento per rinforzo distribuzionale

Il risultato recente più interessante è che la popolazione non codifica un singolo scalare. I singoli neuroni dopaminergici hanno punti di inversione diversi - la magnitudine di ricompensa alla quale passano da eccitazione a inibizione - e differiscono sistematicamente in quanto asimmetricamente pesino errori positivi e negativi. È esattamente la struttura richiesta dall'apprendimento per rinforzo distribuzionale, in cui una popolazione di predittori di valore con parametri di ottimismo diversi rappresenta collettivamente l'intera distribuzione di probabilità sulla ricompensa futura invece della sua media. La distribuzione si può decodificare dalla popolazione, il che significa che il cervello sta seguendo il rischio, non solo l'aspettativa.

03Tonico, fasico e vigore

Le raffiche fasiche su scala di centinaia di millisecondi portano l'errore di previsione; la concentrazione tonica, che varia lentamente, sembra portare qualcos'altro. Il resoconto di Niv lega la dopamina tonica al tasso medio di ricompensa, che nel controllo ottimo fissa il costo opportunità del tempo e quindi il vigore ottimale, cioè quanto in fretta agire. Spiega l'accoppiamento altrimenti curioso fra bradicinesia nella malattia di Parkinson e capacità motoria intatta, e l'effetto degli stimolanti sulla velocità di risposta più che sull'accuratezza. Spiega anche perché la stessa molecola sembri un segnale di apprendimento in un esperimento e un segnale motorio in un altro: scale temporali diverse, quantità diverse.

04Dove il racconto semplice è sbagliato

I neuroni dopaminergici non sono omogenei. Una sottopopolazione sostanziale, in particolare nell'area tegmentale ventrale che proietta alla coda dello striato, risponde a eventi salienti compresi quelli avversivi e a stimoli neutri nuovi, il che non è un errore di previsione della ricompensa sotto nessuna lettura. Il rilascio dopaminergico nello striato dorsale segue posizione e cinematica del movimento in modi che uno scalare di errore non può spiegare, e lavori recenti mostrano onde di rilascio che attraversano lo striato con struttura spaziale. Il campo sta convergendo su una visione in cui è il bersaglio della proiezione, non l'identità della cellula, a determinare che cosa significhi il segnale.

05Dipendenza, e che cosa la dopamina predice davvero

Il modello di Redish tratta le droghe che danno dipendenza come produttrici di un errore di previsione che l'apprendimento non può cancellare, perché la droga agisce farmacologicamente sul segnale di errore invece che attraverso la via della ricompensa di cui la previsione imparerebbe. Il valore degli stati che predicono la droga cresce quindi senza limite, il che corrisponde al quadro clinico meglio di qualsiasi resoconto basato sul piacere: la tolleranza riduce l'effetto edonico mentre il desiderio aumenta, e le ricadute innescate dagli stimoli avvengono molto dopo la fine dell'astinenza. L'implicazione pratica è che il bersaglio del trattamento è l'associazione fra segnale e valore, non il piacere.

Formule chiave

Errore TD\(\delta_t = r_t + \gamma V(s_{t+1}) - V(s_t)\)
Aggiornamento asimmetrico\(V_i \leftarrow V_i + \alpha_i^{+}[\delta]_{+} - \alpha_i^{-}[\delta]_{-}\)
Expectile\(\tau_i = \dfrac{\alpha_i^{+}}{\alpha_i^{+}+\alpha_i^{-}}\)l'ottimismo del neurone
Ricompensa media\(\rho = \lim_{T\to\infty}\tfrac{1}{T}\textstyle\sum_{t} r_t\)dopamina tonica, vigore
Vigore ottimo\(\tau^{*} = \sqrt{C_v/\rho}\)agisci più in fretta quando la ricompensa è fitta

Da sapere

  • I singoli neuroni dopaminergici hanno punti di inversione diversi e ottimismo diverso: esattamente la struttura richiesta dall'apprendimento per rinforzo distribuzionale. La distribuzione sulla ricompensa futura si può decodificare dalla popolazione.
  • La dopamina tonica sembra fissare il vigore codificando il tasso medio di ricompensa, che nel controllo ottimo è il costo opportunità del tempo. Spiega perché la lentezza parkinsoniana convive con una capacità motoria intatta.
  • Le droghe che danno dipendenza producono un errore di previsione che il sistema non riesce a cancellare imparando, perché agiscono sul segnale di errore stesso. Il valore cresce senza limite: è desiderio senza godimento.

Fonti

Articolo completo su Wikipedia ↗