Qu'est-ce que le problème de Monty Hall
Changer de porte double vos chances de gagner. Des milliers de personnes titulaires d'un diplôme de mathématiques ont écrit pour dire que c'était faux. Faites-le tourner dix mille fois et regardez.
Pourquoi changer gagne deux fois plus souvent
Niveau Débutant — langage simple, sans maths
Trois portes. Une voiture derrière l'une, une chèvre derrière chacune des autres. Vous choisissez une porte. L'animateur - qui sait où est la voiture - ouvre l'une des deux que vous n'avez pas choisies, révélant toujours une chèvre. Vous pouvez maintenant garder votre porte ou passer à celle qui reste. Que faire ?
Il faut changer, et cela gagne deux fois plus souvent. Presque personne n'y croit la première fois, et la raison mérite d'être comprise : on a l'impression qu'il reste deux portes, donc que c'est du cinquante-cinquante. Mais les deux portes ne sont pas équivalentes, car l'une d'elles était protégée.
Pensez à votre premier choix. Vous aviez une chance sur trois d'avoir raison, et cela n'a pas changé : l'animateur ouvrant une porte à chèvre ne vous apprend rien sur votre propre porte, puisqu'il allait de toute façon pouvoir ouvrir une porte à chèvre quel que soit votre choix. Votre porte reste donc à une sur trois. Les deux autres valaient ensemble deux sur trois, et elles le valent toujours - sauf que tout cela est maintenant concentré derrière l'unique porte encore debout.
Si cela ne passe toujours pas, utilisez le curseur pour en mettre dix. Vous en choisissez une, l'animateur ouvre huit chèvres, laissant la vôtre et une autre. Là, l'intuition rejoint les mathématiques : votre porte était un coup de dé sur dix, et l'animateur vient soigneusement d'éviter une porte précise huit fois de suite. Puis lancez dix mille parties et regardez les deux courbes se séparer.
Bon à savoir
- Quand Marilyn vos Savant donna la bonne réponse en 1990, elle reçut environ 10 000 lettres lui disant qu'elle avait tort, dont environ 1 000 de personnes titulaires d'un doctorat.
- Avec dix portes, changer gagne 90% du temps. Le mécanisme est identique à la version à trois portes - c'est seulement plus facile à ressentir.
- Paul Erdős, l'un des mathématiciens les plus prolifiques du siècle, refusa d'accepter la réponse jusqu'à ce qu'on lui montre une simulation informatique.
Probabilité conditionnelle, et pourquoi le savoir de l'animateur est tout le problème
Niveau Élève — les équations essentielles
Numérotez les portes 1, 2, 3, supposez que vous choisissez la porte 1, et soit \(C_i\) l'événement « la voiture est derrière la porte \(i\) », chacun de probabilité a priori \(1/3\). Soit \(H_3\) l'événement « l'animateur ouvre la porte 3 ». Ce sont les vraisemblances qui portent l'argument : \(P(H_3|C_1) = 1/2\), car si la voiture est derrière votre porte l'animateur peut ouvrir l'une ou l'autre des restantes ; \(P(H_3|C_2) = 1\), car il y est contraint ; \(P(H_3|C_3) = 0\), car il ne révèle jamais la voiture.
Bayes donne alors \(P(C_1|H_3) = \frac{(1/3)(1/2)}{(1/3)(1/2)+(1/3)(1)} = 1/3\) et \(P(C_2|H_3) = 2/3\). L'asymétrie vient entièrement des vraisemblances, non des probabilités a priori : l'action de l'animateur est deux fois plus probable sous l'hypothèse que la voiture est derrière l'autre porte, l'évidence favorise donc le changement d'un facteur deux.
Tout repose sur les contraintes de l'animateur, et l'énigme est notoirement ambiguë quand on les laisse implicites. Si l'animateur ignore où est la voiture et ouvre une porte au hasard, alors, conditionnellement au fait qu'il ait révélé une chèvre par hasard, les probabilités sont réellement égales et changer n'apporte rien. L'événement observé identique - une chèvre derrière une porte ouverte - porte une information différente selon le processus qui l'a produit. C'est la leçon la plus précieuse du problème et celle qu'on saute d'ordinaire.
La généralisation est nette. Avec \(n\) portes, une voiture, vous en choisissez une et l'animateur en ouvre \(n-2\) à chèvre : changer gagne avec probabilité \(\frac{n-1}{n}\). À \(n = 3\) c'est le familier \(2/3\) ; à \(n = 100\) c'est \(99\%\), version à sortir quand quelqu'un n'est pas convaincu. Dans tous les cas votre porte initiale conserve sa probabilité a priori de \(1/n\), et tout le reste \(\frac{n-1}{n}\) est canalisé sur une seule porte.
Formules clés
| A priori | \(P(C_i) = \tfrac{1}{3}\) | |
|---|---|---|
| Vraisemblances | \(P(H_3|C_1)=\tfrac12,\; P(H_3|C_2)=1,\; P(H_3|C_3)=0\) | |
| A posteriori, rester | \(P(C_1|H_3) = \tfrac{1}{3}\) | |
| A posteriori, changer | \(P(C_2|H_3) = \tfrac{2}{3}\) | |
| Avec n portes | \(P(\text{changer gagne}) = \dfrac{n-1}{n}\) | |
Bon à savoir
- Si l'animateur choisit au hasard et révèle une chèvre par chance, changer n'apporte rien. Même résultat visible, processus générateur différent, information différente.
- Le problème est équivalent au paradoxe des boîtes de Bertrand de 1889 et au problème des trois prisonniers de 1959. Il est sans cesse redécouvert parce que l'intuition échoue de façon fiable.
- La réponse générale est (n−1)/n. Le cas à trois portes est le plus difficile à ressentir précisément parce que 2/3 est le minimum que l'avantage atteigne jamais.
Dépendance au protocole, les variantes Monty Fall et pourquoi l'intuition échoue
Niveau Expert — profondeur mathématique complète
01Le problème est sous-déterminé tant que le protocole n'est pas fixé
L'énoncé classique ne précise pas les règles de l'animateur, et la réponse en dépend réellement. Sous le protocole standard - l'animateur ouvre toujours une porte, toujours une chèvre, jamais la vôtre, et choisit uniformément quand il a le choix - changer gagne avec probabilité \(2/3\). Sous Monty Fall, où l'animateur trébuche et ouvre une porte au hasard qui se trouve être une chèvre, la probabilité a posteriori est \(1/2\) et changer ne sert à rien. Sous Monty Crawl, où un animateur paresseux ouvre toujours la porte permise de plus petit numéro, la réponse dépend de la porte ouverte : parfois \(1/2\), parfois \(1\). Les données observées sont identiques dans les trois cas ; seul le mécanisme d'échantillonnage diffère.
02Choix non uniforme de l'animateur, et la version en théorie des jeux
Supposons que l'animateur, quand il est libre de choisir, ouvre la porte 3 avec probabilité \(q\). Alors \(P(C_1|H_3) = \frac{q}{q+1}\), variant de \(0\) à \(1/2\) lorsque \(q\) va de 0 à 1. Changer n'est donc jamais pire que rester et est strictement meilleur sauf si \(q = 1\) : cette stratégie domine faiblement pour toute politique de l'animateur. Traité comme un jeu à somme nulle contre un animateur adverse, la stratégie minimax du candidat est de changer, garantissant \(2/3\), et celle de l'animateur est \(q = 1/2\) - la règle uniforme est le jeu optimal de l'animateur, ce qui justifie agréablement l'hypothèse conventionnelle.
03Pourquoi l'intuition échoue, expérimentalement
L'explication dominante est le biais d'équiprobabilité : quand l'espace des résultats a été réduit à deux, les gens attribuent par défaut des probabilités égales sans égard au processus ayant produit la réduction. Un second facteur est une heuristique du nombre de cas, qui compte les états au lieu de les pondérer. Le résultat qui en fait plus qu'une curiosité est que l'erreur persiste en jeu répété avec retour d'information : les gens n'apprennent pas de façon fiable à changer même après des dizaines d'essais, ce qui est inhabituel pour une tâche à information immédiate sur le résultat et suggère un échec représentationnel plutôt qu'un manque d'évidence.
04Les pigeons, et ce que cela implique
Herbranson et Schroeder ont entraîné des pigeons sur le problème avec des récompenses alimentaires. En une trentaine de sessions, les pigeons ont convergé vers le changement à des taux supérieurs à 90% ; les humains en condition comparable sont restés près de 60% et progressent lentement. L'interprétation est que les pigeons se comportent en purs maximisateurs empiriques, ajustant leurs choix aux fréquences de récompense observées, tandis que les humains déploient un modèle causal de la situation et que leur modèle est faux. Avoir une théorie est normalement un avantage, et c'est ici précisément ce qui fait le dégât.
05Le principe général à retenir
La leçon transférable est que les vraisemblances dépendent du mécanisme générateur des données, pas des données. C'est la même structure que le biais de sélection dans les essais cliniques, que la différence entre données manquantes au hasard et manquantes non au hasard, et que le paradoxe du garçon ou de la fille où la réponse dépend de la façon dont l'information a été obtenue. Monty Hall survit comme exemple pédagogique parce que c'est le problème le plus court où l'observation est fixe, la réponse bouge, et la seule chose qui a changé est la manière dont l'observation a été faite.
Formules clés
| Bayes | \(P(C_i|H_3) = \dfrac{P(H_3|C_i)P(C_i)}{\sum_j P(H_3|C_j)P(C_j)}\) | |
|---|---|---|
| Animateur biaisé | \(P(C_1|H_3) = \dfrac{q}{q+1}\) | q = préférence pour la porte 3 |
| Monty Fall | \(P(C_1|H_3,\text{hasard}) = \tfrac{1}{2}\) | mêmes données, aucune information |
| Minimax | \(\text{changer garantit } \tfrac{2}{3};\quad q^{*}=\tfrac12\) | |
Bon à savoir
- Les pigeons apprennent à changer en une trentaine de sessions et dépassent 90%. Les humains avec le même retour d'information restent près de 60%, apparemment parce qu'ils ont un modèle causal et qu'il est faux.
- Si l'animateur préfère la porte 3 avec probabilité q, rester gagne avec probabilité q/(q+1). Changer domine faiblement pour toute politique possible de l'animateur.
- Traité comme un jeu à somme nulle, la stratégie minimax du candidat est de changer et celle de l'animateur de choisir uniformément - ce qui est exactement l'hypothèse de la version classique.