Saltar al contenido

El Modelo de Razonamiento o1 de OpenAI Superó a los Médicos en Diagnóstico en un Estudio Real de Harvard-Stanford

Un estudio publicado el 30 de abril en Science por investigadores de Harvard, Beth Israel Deaconess y Stanford concluyó que el modelo de razonamiento o1 de OpenAI recibió puntuaciones perfectas de razonamiento clínico en el 98% de los casos, frente al 35% de los médicos titulares.

Inteligencia ArtificialEquipo Editorial GNGV5 min lectura

El 30 de abril de 2026, la revista Science publicó un estudio de investigadores de Harvard Medical School, Beth Israel Deaconess Medical Center y Stanford que evaluó cómo el modelo de razonamiento "o1" de OpenAI se desempeña en casos reales de urgencias. NPR y STAT cubrieron el resultado ese mismo día: en pruebas directas usando solo los expedientes electrónicos disponibles en el momento de la atención, el modelo igualó o superó a médicos experimentados en diagnóstico, pruebas recomendadas y decisiones de manejo del caso.

La cifra más llamativa surge de las evaluaciones de razonamiento clínico: o1 recibió la puntuación perfecta en el 98% de los casos analizados, frente al 35% de los médicos titulares. El modelo fue especialmente potente en enfermedades raras y casos complejos multisistémicos — donde el sesgo cognitivo humano suele fallar. También superó a GPT-4, la línea base anterior.

Los autores son explícitos: esto no significa que la IA deba sustituir a los médicos. El estudio evaluó la calidad del razonamiento, no los resultados del paciente. Defienden que el próximo paso son ensayos controlados en flujos clínicos reales, con la IA asistiendo en casos difíciles bajo supervisión humana.

El resultado se enmarca en un debate más amplio sobre la IA en medicina. Un informe separado de la OMS/Europa que cubre los 27 Estados miembros de la UE halló que el 74% ya utiliza IA en diagnóstico.

Fuentes

Siga leyendo