Lab-in-a-Tab

Que fait vraiment la dopamine

Ce n'est pas la molécule du plaisir. Les neurones dopaminergiques déchargent quand les choses vont mieux que prévu, et se taisent quand une récompense arrive exactement comme annoncé.

Prédiction de récompenseApprentissageStriatum
EssaieContentez-vous de regarder les vingt premiers tours et suivez la ligne jaune et la bleue se croiser : la bosse passe du jus à la lampe toute seule. Puis appuyez sur Retirer la récompense et regardez le creux exactement là où le jus aurait dû arriver. Enfin descendez À quelle fréquence vient la récompense à environ la moitié et voyez que la bosse au jus ne disparaît jamais tout à fait.
Ce que tu voisUn tour à la fois, qui se répète en boucle. Une lampe s'allume, puis après une attente arrive une goutte de jus. En dessous, ce que fait la cellule dopaminergique à chaque instant : une bosse au-dessus de son rythme normal, ou un creux en dessous. En bas, le registre de chaque tour effectué jusqu'ici : la ligne rose est ce que la lampe en est venue à signifier, la ligne jaune est la bosse à la lampe, la ligne bleue est la bosse au jus.
À remarquer
La cellule ne rapporte pas à quel point le jus est bon. Elle rapporte à quel point les choses sont allées mieux que prévu. C'est pourquoi la bosse se déplace. Au début le jus est une surprise, donc c'est le jus qui prend la bosse ; une fois que la lampe le prédit de façon fiable, le jus est exactement ce qui était prévu et il ne reste rien à rapporter, tandis que la lampe est devenue le moment où la nouvelle arrive vraiment. La preuve est ce qui se passe quand vous retirez la récompense : rien de mauvais n'est arrivé, c'est simplement que quelque chose de bon n'est pas arrivé, et la cellule descend sous son rythme normal à la seconde précise où le jus était dû. Ce qui vous dit aussi une chose discrètement remarquable : le cerveau chronométrait la prédiction, il ne se contentait pas de la faire.

Le signal de la surprise, pas celui du plaisir

Niveau Débutant — langage simple, sans maths

On décrit la dopamine comme la molécule du plaisir du cerveau, et cette description est fausse d'une manière qui compte. L'expérience qui a tranché est assez simple pour tenir en un après-midi. Donnez à un singe assoiffé une goutte de jus sans prévenir, et les neurones dopaminergiques déchargent une bouffée. Jusque-là, l'histoire du plaisir tient.

Faites-le maintenant cent fois, mais allumez une lampe deux secondes avant chaque goutte. Il se passe une chose étrange. La bouffée au jus devient de plus en plus petite jusqu'à disparaître complètement, et une nouvelle bouffée apparaît à la lampe. Le singe aime toujours le jus. Il le boit avec le même empressement. Mais les neurones ont cessé d'y réagir.

Ce qu'ils rapportent, ce n'est pas à quel point une chose est bonne. C'est à quel point elle est meilleure que prévu. Une goutte inattendue est une bonne surprise, donc il y a une bouffée. Une goutte que vous avez vue venir deux secondes plus tôt est exactement ce que vous aviez prédit, donc il n'y a rien à rapporter. La lampe, en revanche, est une information vraiment nouvelle - elle signifie que du jus arrive - et c'est elle qui reçoit la bouffée désormais.

La preuve est dans ce qui se passe quand vous rompez la promesse. Allumez la lampe puis ne donnez pas de jus, et à l'instant exact où la goutte aurait dû arriver, les neurones descendent sous leur rythme normal. Rien de mauvais n'est arrivé ; c'est simplement que quelque chose de bon n'est pas arrivé. Appuyez sur le bouton dans la simulation et regardez le creux apparaître.

Bon à savoir

  • Les singes des expériences de Wolfram Schultz buvaient le jus avec le même empressement après que la réponse dopaminergique au jus avait entièrement disparu. Aimer une chose et la signaler sont deux choses distinctes.
  • Une récompense attendue qui n'arrive pas pousse la dopamine sous la ligne de base précisément au moment où elle était due, ce qui signifie que le cerveau chronomètre la prédiction et ne se contente pas de la faire.
  • Les récompenses imprévisibles maintiennent la bouffée indéfiniment, parce qu'elles ne sont jamais complètement prédites. C'est le mécanisme autour duquel une machine à sous est construite.

Erreur de prédiction de récompense et apprentissage par différences temporelles

Niveau Élève — les équations essentielles

La quantité que codent les neurones dopaminergiques a une définition précise empruntée à l'apprentissage par renforcement : l'erreur de prédiction de récompense, \(\delta = r - V\), où \(r\) est ce qui est arrivé et \(V\) ce qui était prédit. Un \(\delta\) positif signifie mieux que prévu et produit une bouffée ; zéro ne produit rien ; négatif produit une pause sous la ligne de base. L'apprentissage est alors simplement \(V \leftarrow V + \alpha\delta\) : déplacer la prédiction vers la réalité d'une fraction de l'erreur. C'est la règle de Rescorla-Wagner, proposée en 1972 à partir de données d'apprentissage animal, et les neurones dopaminergiques semblent l'implémenter.

La structure temporelle exige la version complète. Dans l'apprentissage par différences temporelles, l'erreur est \(\delta_t = r_t + \gamma V(s_{t+1}) - V(s_t)\) : un état a de la valeur s'il mène à des états de valeur. C'est ce qui fait migrer la réponse en arrière dans le temps vers le premier prédicteur fiable, exactement comme on l'observe, et cela explique le creux à l'omission de la récompense sans hypothèse supplémentaire : \(V(s_{t+1})\) s'effondre à zéro quand la récompense attendue n'apparaît pas.

La correspondance est inhabituellement serrée pour les neurosciences. L'apprentissage TD a été développé comme solution calculatoire à un problème d'attribution du mérite, et la coïncidence avec la décharge dopaminergique a été remarquée ensuite : une prédiction, pas un ajustement après coup. La dopamine agit aussi comme signal de plasticité et pas seulement comme compte rendu : elle ouvre la porte à la potentialisation à long terme aux synapses cortico-striatales, si bien que le signal d'erreur modifie directement les poids qui ont produit la prédiction.

La distinction qui en découle est entre vouloir et aimer, et elle est expérimentalement nette. Les rats privés de dopamine montrent encore des réactions faciales de plaisir normales au saccharose - le goût leur plaît parfaitement - mais ne travaillent pas pour l'obtenir. La dopamine attribue une saillance incitative : elle rend les indices motivants. C'est pourquoi l'addiction se décrit mieux comme un vouloir pathologique que comme un plaisir excessif, et pourquoi les gens rapportent désirer des substances qu'ils n'apprécient plus.

Formules clés

Erreur de prédiction\(\delta = r - V\)la taille de la bouffée
Rescorla-Wagner\(V \leftarrow V + \alpha\,\delta\)
Différence temporelle\(\delta_t = r_t + \gamma V(s_{t+1}) - V(s_t)\)
Valeur d'un état\(V(s) = \mathbb{E}\!\left[\textstyle\sum_{k} \gamma^{k} r_{t+k}\right]\)
À l'omission\(\delta = 0 - V = -V\)le creux sous la ligne de base

Bon à savoir

  • L'apprentissage TD a été inventé pour résoudre un problème d'apprentissage automatique. La coïncidence avec la décharge dopaminergique a été trouvée ensuite : l'un des cas les plus nets d'une théorie calculatoire prédisant une mesure biologique.
  • Les rats privés de dopamine font encore les mêmes mimiques de plaisir devant le sucre, mais ne traversent pas une pièce pour l'avoir. Vouloir et aimer sont séparables, et la dopamine porte le vouloir.
  • La dopamine ne se contente pas de rapporter l'erreur : elle ouvre la plasticité aux synapses qui ont fait la prédiction. Le signal et la règle d'apprentissage partagent la même molécule.

Codage distributionnel, tonique contre phasique, et où le récit simple se brise

Niveau Expert — profondeur mathématique complète

01Le récit canonique et ses preuves

Les enregistrements de Schultz ont établi les trois signatures - bouffée à la récompense non prédite, transfert au premier prédicteur, creux à l'omission - et l'optogénétique a ensuite fourni la causalité : faire décharger artificiellement les neurones dopaminergiques au moment de la livraison produit un apprentissage comme si la récompense avait été meilleure qu'elle ne l'était, et les supprimer produit l'extinction. Le signal évolue aussi avec la probabilité et la magnitude comme \(\delta\) l'exige, et montre l'asymétrie correcte, puisque les fréquences de décharge ont un plancher à zéro alors que les bouffées n'en ont pas : les erreurs négatives sont codées par la durée de la pause plutôt que par la fréquence.

02Apprentissage par renforcement distributionnel

Le résultat récent le plus intéressant est que la population ne code pas un scalaire unique. Les neurones dopaminergiques individuels ont des points d'inversion différents - la magnitude de récompense à laquelle ils passent de l'excitation à l'inhibition - et diffèrent systématiquement dans la façon dont ils pondèrent asymétriquement les erreurs positives et négatives. C'est exactement la structure requise par l'apprentissage par renforcement distributionnel, où une population de prédicteurs de valeur aux paramètres d'optimisme différents représente collectivement toute la distribution de probabilité sur la récompense future plutôt que sa moyenne. La distribution peut être décodée depuis la population, ce qui signifie que le cerveau suit le risque, pas seulement l'espérance.

03Tonique, phasique et vigueur

Les bouffées phasiques à l'échelle de la centaine de millisecondes portent l'erreur de prédiction ; la concentration tonique, à variation lente, semble porter autre chose. Le récit de Niv lie la dopamine tonique au taux moyen de récompense, qui en contrôle optimal fixe le coût d'opportunité du temps et donc la vigueur optimale, c'est-à-dire à quelle vitesse agir. Cela explique l'appariement autrement curieux entre bradykinésie dans la maladie de Parkinson et capacité motrice intacte, et l'effet des stimulants sur la vitesse de réponse plutôt que sur l'exactitude. Cela explique aussi pourquoi la même molécule ressemble à un signal d'apprentissage dans une expérience et à un signal moteur dans une autre : échelles de temps différentes, quantités différentes.

04Là où le récit simple est faux

Les neurones dopaminergiques ne sont pas homogènes. Une sous-population substantielle, notamment dans l'aire tegmentale ventrale projetant vers la queue du striatum, répond à des événements saillants y compris aversifs et à des stimuli neutres nouveaux, ce qui n'est une erreur de prédiction de récompense sous aucune lecture. La libération dopaminergique dans le striatum dorsal suit la position et la cinématique du mouvement d'une façon qu'un scalaire d'erreur ne peut expliquer, et des travaux récents montrent des vagues de libération traversant le striatum avec une structure spatiale. Le domaine converge vers une vue où c'est la cible de la projection, et non l'identité de la cellule, qui détermine le sens du signal.

05Addiction, et ce que la dopamine prédit vraiment

Le modèle de Redish traite les drogues addictives comme produisant une erreur de prédiction que l'apprentissage ne peut annuler, parce que la drogue agit pharmacologiquement sur le signal d'erreur plutôt que par la voie de récompense dont la prédiction apprendrait. La valeur des états prédisant la drogue croît donc sans borne, ce qui correspond au tableau clinique mieux que tout récit fondé sur le plaisir : la tolérance réduit l'effet hédonique pendant que le besoin augmente, et les rechutes déclenchées par les indices surviennent longtemps après la fin du sevrage. L'implication pratique est que la cible du traitement est l'association entre indice et valeur, pas le plaisir.

Formules clés

Erreur TD\(\delta_t = r_t + \gamma V(s_{t+1}) - V(s_t)\)
Mise à jour asymétrique\(V_i \leftarrow V_i + \alpha_i^{+}[\delta]_{+} - \alpha_i^{-}[\delta]_{-}\)
Expectile\(\tau_i = \dfrac{\alpha_i^{+}}{\alpha_i^{+}+\alpha_i^{-}}\)l'optimisme du neurone
Récompense moyenne\(\rho = \lim_{T\to\infty}\tfrac{1}{T}\textstyle\sum_{t} r_t\)dopamine tonique, vigueur
Vigueur optimale\(\tau^{*} = \sqrt{C_v/\rho}\)agir plus vite quand la récompense est dense

Bon à savoir

  • Les neurones dopaminergiques individuels ont des points d'inversion et un optimisme différents : exactement la structure requise par l'apprentissage par renforcement distributionnel. La distribution sur la récompense future peut être décodée depuis la population.
  • La dopamine tonique semble fixer la vigueur en codant le taux moyen de récompense, qui en contrôle optimal est le coût d'opportunité du temps. Cela explique pourquoi la lenteur parkinsonienne coexiste avec une capacité motrice intacte.
  • Les drogues addictives produisent une erreur de prédiction que le système ne peut apprendre à annuler, parce qu'elles agissent sur le signal d'erreur lui-même. La valeur croît sans borne : c'est le besoin sans la jouissance.

Sources

Article complet sur Wikipédia ↗