Le modèle de raisonnement o1 d'OpenAI surpasse les médecins en diagnostic dans une étude réelle Harvard-Stanford
Une étude publiée le 30 avril dans Science par des chercheurs de Harvard, Beth Israel Deaconess et Stanford révèle que le modèle de raisonnement o1 d'OpenAI a obtenu un score parfait de raisonnement clinique dans 98 % des cas, contre 35 % pour les médecins titulaires.
Intelligence ArtificielleÉquipe éditoriale GNGV5 min de lecture
Le 30 avril 2026, la revue Science a publié une étude menée par des chercheurs de Harvard Medical School, du Beth Israel Deaconess Medical Center et de Stanford, qui évalue les performances du modèle de raisonnement « o1 » d'OpenAI sur de vrais cas d'urgences. NPR et STAT ont couvert le résultat le jour même : en utilisant uniquement les dossiers médicaux électroniques disponibles au moment des soins, le modèle a égalé ou dépassé des médecins expérimentés en diagnostic, examens recommandés et gestion des cas.
Le chiffre le plus frappant vient des évaluations du raisonnement clinique : o1 a obtenu un score parfait dans 98 % des cas analysés, contre 35 % pour les médecins titulaires. Le modèle s'est révélé particulièrement performant sur les maladies rares et les cas complexes multi-systèmes. Il a aussi surpassé GPT-4, la base précédente.
Les auteurs sont clairs : cela ne signifie pas que l'IA doit remplacer les médecins. L'étude évaluait la qualité du raisonnement, pas les résultats des patients. Ils plaident pour des essais contrôlés en conditions cliniques réelles, l'IA assistant sur les cas difficiles sous supervision humaine.
Le résultat s'inscrit dans un débat plus large : un rapport OMS/Europe couvrant les 27 États membres de l'UE indique que 74 % d'entre eux utilisent déjà l'IA en diagnostic.