Que fait vraiment la dopamine
Ce n'est pas la molécule du plaisir. Les neurones dopaminergiques déchargent quand les choses vont mieux que prévu, et se taisent quand une récompense arrive exactement comme annoncé.
Le signal de la surprise, pas celui du plaisir
Niveau Débutant — langage simple, sans maths
On décrit la dopamine comme la molécule du plaisir du cerveau, et cette description est fausse d'une manière qui compte. L'expérience qui a tranché est assez simple pour tenir en un après-midi. Donnez à un singe assoiffé une goutte de jus sans prévenir, et les neurones dopaminergiques déchargent une bouffée. Jusque-là, l'histoire du plaisir tient.
Faites-le maintenant cent fois, mais allumez une lampe deux secondes avant chaque goutte. Il se passe une chose étrange. La bouffée au jus devient de plus en plus petite jusqu'à disparaître complètement, et une nouvelle bouffée apparaît à la lampe. Le singe aime toujours le jus. Il le boit avec le même empressement. Mais les neurones ont cessé d'y réagir.
Ce qu'ils rapportent, ce n'est pas à quel point une chose est bonne. C'est à quel point elle est meilleure que prévu. Une goutte inattendue est une bonne surprise, donc il y a une bouffée. Une goutte que vous avez vue venir deux secondes plus tôt est exactement ce que vous aviez prédit, donc il n'y a rien à rapporter. La lampe, en revanche, est une information vraiment nouvelle - elle signifie que du jus arrive - et c'est elle qui reçoit la bouffée désormais.
La preuve est dans ce qui se passe quand vous rompez la promesse. Allumez la lampe puis ne donnez pas de jus, et à l'instant exact où la goutte aurait dû arriver, les neurones descendent sous leur rythme normal. Rien de mauvais n'est arrivé ; c'est simplement que quelque chose de bon n'est pas arrivé. Appuyez sur le bouton dans la simulation et regardez le creux apparaître.
Bon à savoir
- Les singes des expériences de Wolfram Schultz buvaient le jus avec le même empressement après que la réponse dopaminergique au jus avait entièrement disparu. Aimer une chose et la signaler sont deux choses distinctes.
- Une récompense attendue qui n'arrive pas pousse la dopamine sous la ligne de base précisément au moment où elle était due, ce qui signifie que le cerveau chronomètre la prédiction et ne se contente pas de la faire.
- Les récompenses imprévisibles maintiennent la bouffée indéfiniment, parce qu'elles ne sont jamais complètement prédites. C'est le mécanisme autour duquel une machine à sous est construite.
Erreur de prédiction de récompense et apprentissage par différences temporelles
Niveau Élève — les équations essentielles
La quantité que codent les neurones dopaminergiques a une définition précise empruntée à l'apprentissage par renforcement : l'erreur de prédiction de récompense, \(\delta = r - V\), où \(r\) est ce qui est arrivé et \(V\) ce qui était prédit. Un \(\delta\) positif signifie mieux que prévu et produit une bouffée ; zéro ne produit rien ; négatif produit une pause sous la ligne de base. L'apprentissage est alors simplement \(V \leftarrow V + \alpha\delta\) : déplacer la prédiction vers la réalité d'une fraction de l'erreur. C'est la règle de Rescorla-Wagner, proposée en 1972 à partir de données d'apprentissage animal, et les neurones dopaminergiques semblent l'implémenter.
La structure temporelle exige la version complète. Dans l'apprentissage par différences temporelles, l'erreur est \(\delta_t = r_t + \gamma V(s_{t+1}) - V(s_t)\) : un état a de la valeur s'il mène à des états de valeur. C'est ce qui fait migrer la réponse en arrière dans le temps vers le premier prédicteur fiable, exactement comme on l'observe, et cela explique le creux à l'omission de la récompense sans hypothèse supplémentaire : \(V(s_{t+1})\) s'effondre à zéro quand la récompense attendue n'apparaît pas.
La correspondance est inhabituellement serrée pour les neurosciences. L'apprentissage TD a été développé comme solution calculatoire à un problème d'attribution du mérite, et la coïncidence avec la décharge dopaminergique a été remarquée ensuite : une prédiction, pas un ajustement après coup. La dopamine agit aussi comme signal de plasticité et pas seulement comme compte rendu : elle ouvre la porte à la potentialisation à long terme aux synapses cortico-striatales, si bien que le signal d'erreur modifie directement les poids qui ont produit la prédiction.
La distinction qui en découle est entre vouloir et aimer, et elle est expérimentalement nette. Les rats privés de dopamine montrent encore des réactions faciales de plaisir normales au saccharose - le goût leur plaît parfaitement - mais ne travaillent pas pour l'obtenir. La dopamine attribue une saillance incitative : elle rend les indices motivants. C'est pourquoi l'addiction se décrit mieux comme un vouloir pathologique que comme un plaisir excessif, et pourquoi les gens rapportent désirer des substances qu'ils n'apprécient plus.
Formules clés
| Erreur de prédiction | \(\delta = r - V\) | la taille de la bouffée |
|---|---|---|
| Rescorla-Wagner | \(V \leftarrow V + \alpha\,\delta\) | |
| Différence temporelle | \(\delta_t = r_t + \gamma V(s_{t+1}) - V(s_t)\) | |
| Valeur d'un état | \(V(s) = \mathbb{E}\!\left[\textstyle\sum_{k} \gamma^{k} r_{t+k}\right]\) | |
| À l'omission | \(\delta = 0 - V = -V\) | le creux sous la ligne de base |
Bon à savoir
- L'apprentissage TD a été inventé pour résoudre un problème d'apprentissage automatique. La coïncidence avec la décharge dopaminergique a été trouvée ensuite : l'un des cas les plus nets d'une théorie calculatoire prédisant une mesure biologique.
- Les rats privés de dopamine font encore les mêmes mimiques de plaisir devant le sucre, mais ne traversent pas une pièce pour l'avoir. Vouloir et aimer sont séparables, et la dopamine porte le vouloir.
- La dopamine ne se contente pas de rapporter l'erreur : elle ouvre la plasticité aux synapses qui ont fait la prédiction. Le signal et la règle d'apprentissage partagent la même molécule.
Codage distributionnel, tonique contre phasique, et où le récit simple se brise
Niveau Expert — profondeur mathématique complète
01Le récit canonique et ses preuves
Les enregistrements de Schultz ont établi les trois signatures - bouffée à la récompense non prédite, transfert au premier prédicteur, creux à l'omission - et l'optogénétique a ensuite fourni la causalité : faire décharger artificiellement les neurones dopaminergiques au moment de la livraison produit un apprentissage comme si la récompense avait été meilleure qu'elle ne l'était, et les supprimer produit l'extinction. Le signal évolue aussi avec la probabilité et la magnitude comme \(\delta\) l'exige, et montre l'asymétrie correcte, puisque les fréquences de décharge ont un plancher à zéro alors que les bouffées n'en ont pas : les erreurs négatives sont codées par la durée de la pause plutôt que par la fréquence.
02Apprentissage par renforcement distributionnel
Le résultat récent le plus intéressant est que la population ne code pas un scalaire unique. Les neurones dopaminergiques individuels ont des points d'inversion différents - la magnitude de récompense à laquelle ils passent de l'excitation à l'inhibition - et diffèrent systématiquement dans la façon dont ils pondèrent asymétriquement les erreurs positives et négatives. C'est exactement la structure requise par l'apprentissage par renforcement distributionnel, où une population de prédicteurs de valeur aux paramètres d'optimisme différents représente collectivement toute la distribution de probabilité sur la récompense future plutôt que sa moyenne. La distribution peut être décodée depuis la population, ce qui signifie que le cerveau suit le risque, pas seulement l'espérance.
03Tonique, phasique et vigueur
Les bouffées phasiques à l'échelle de la centaine de millisecondes portent l'erreur de prédiction ; la concentration tonique, à variation lente, semble porter autre chose. Le récit de Niv lie la dopamine tonique au taux moyen de récompense, qui en contrôle optimal fixe le coût d'opportunité du temps et donc la vigueur optimale, c'est-à-dire à quelle vitesse agir. Cela explique l'appariement autrement curieux entre bradykinésie dans la maladie de Parkinson et capacité motrice intacte, et l'effet des stimulants sur la vitesse de réponse plutôt que sur l'exactitude. Cela explique aussi pourquoi la même molécule ressemble à un signal d'apprentissage dans une expérience et à un signal moteur dans une autre : échelles de temps différentes, quantités différentes.
04Là où le récit simple est faux
Les neurones dopaminergiques ne sont pas homogènes. Une sous-population substantielle, notamment dans l'aire tegmentale ventrale projetant vers la queue du striatum, répond à des événements saillants y compris aversifs et à des stimuli neutres nouveaux, ce qui n'est une erreur de prédiction de récompense sous aucune lecture. La libération dopaminergique dans le striatum dorsal suit la position et la cinématique du mouvement d'une façon qu'un scalaire d'erreur ne peut expliquer, et des travaux récents montrent des vagues de libération traversant le striatum avec une structure spatiale. Le domaine converge vers une vue où c'est la cible de la projection, et non l'identité de la cellule, qui détermine le sens du signal.
05Addiction, et ce que la dopamine prédit vraiment
Le modèle de Redish traite les drogues addictives comme produisant une erreur de prédiction que l'apprentissage ne peut annuler, parce que la drogue agit pharmacologiquement sur le signal d'erreur plutôt que par la voie de récompense dont la prédiction apprendrait. La valeur des états prédisant la drogue croît donc sans borne, ce qui correspond au tableau clinique mieux que tout récit fondé sur le plaisir : la tolérance réduit l'effet hédonique pendant que le besoin augmente, et les rechutes déclenchées par les indices surviennent longtemps après la fin du sevrage. L'implication pratique est que la cible du traitement est l'association entre indice et valeur, pas le plaisir.
Formules clés
| Erreur TD | \(\delta_t = r_t + \gamma V(s_{t+1}) - V(s_t)\) | |
|---|---|---|
| Mise à jour asymétrique | \(V_i \leftarrow V_i + \alpha_i^{+}[\delta]_{+} - \alpha_i^{-}[\delta]_{-}\) | |
| Expectile | \(\tau_i = \dfrac{\alpha_i^{+}}{\alpha_i^{+}+\alpha_i^{-}}\) | l'optimisme du neurone |
| Récompense moyenne | \(\rho = \lim_{T\to\infty}\tfrac{1}{T}\textstyle\sum_{t} r_t\) | dopamine tonique, vigueur |
| Vigueur optimale | \(\tau^{*} = \sqrt{C_v/\rho}\) | agir plus vite quand la récompense est dense |
Bon à savoir
- Les neurones dopaminergiques individuels ont des points d'inversion et un optimisme différents : exactement la structure requise par l'apprentissage par renforcement distributionnel. La distribution sur la récompense future peut être décodée depuis la population.
- La dopamine tonique semble fixer la vigueur en codant le taux moyen de récompense, qui en contrôle optimal est le coût d'opportunité du temps. Cela explique pourquoi la lenteur parkinsonienne coexiste avec une capacité motrice intacte.
- Les drogues addictives produisent une erreur de prédiction que le système ne peut apprendre à annuler, parce qu'elles agissent sur le signal d'erreur lui-même. La valeur croît sans borne : c'est le besoin sans la jouissance.