Traducción sin revisarLa traducción al Español de esta entrada no ha sido revisada por pares y puede diferir del original. El acrónimo, el título completo y la cita permanecen siempre en el idioma original.Abrir la publicación original ↗

Goh GPT-4 (management reasoning)

GPT-4 Assistance for Improvement of Physician Performance on Patient Care Tasks: A Randomized Controlled Trial

Paciente / Población Intervención / Exposición Comparación Desenlace

En 92 médicos respondiendo viñetas clínicas, GPT-4 junto a los recursos convencionales mejoró las puntuaciones de razonamiento de manejo en comparación con los recursos convencionales solos.

N
92pacientes
Diseño
RCT, médicos aleatorizados, viñetas simuladas
Desenlace
Diferencia de la puntuación total entre grupos en rúbricas de razonamiento de manejo elaboradas por expertos
Relevancia
1Define la práctica — el ensayo en el que se apoya la guía.
ResultadoDiferencia media de la puntuación total +6,5 % con GPT-4 (IC del 95 % 2,7–10,2; p<0,001); los usuarios del LLM dedicaron 119,3 s más por caso (IC del 95 % 17,4–221,2; p=0,02). Médicos con LLM vs. LLM solo −0,9 % (IC del 95 % −9,0 a 7,2; p=0,8).
Goh E, et al. Nat Med. 2025;31(4):1233-1238. 10.1038/s41591-024-03456-y
Discusión y crítica

La contrapartida positiva del ensayo de razonamiento diagnóstico (Goh LLM (diagnostic reasoning)): en tareas de manejo abiertas los médicos con GPT-4 puntuaron más alto, y no mejor que el LLM solo. Viñetas en un entorno simulado calificadas por rúbrica, sin resultados en pacientes — los propios autores reclaman validación en la práctica clínica real.