Traducción sin revisarLa traducción al Español de esta entrada no ha sido revisada por pares y puede diferir del original. El acrónimo, el título completo y la cita permanecen siempre en el idioma original.Abrir la publicación original ↗

Goh LLM (diagnostic reasoning)

Large Language Model Influence on Diagnostic Reasoning: A Randomized Clinical Trial

Paciente / Población Intervención / Exposición Comparación Desenlace

En 50 médicos resolviendo viñetas clínicas, el acceso a un gran modelo de lenguaje junto a los recursos convencionales no mejoró las puntuaciones de razonamiento diagnóstico en comparación con los recursos convencionales solos.

N
50pacientes
Diseño
RCT simple ciego, médicos aleatorizados, multicéntrico
Desenlace
Puntuación de razonamiento diagnóstico por caso en una rúbrica estandarizada (exactitud del diagnóstico diferencial, factores a favor/en contra, siguientes pasos diagnósticos), calificada por consenso de expertos ciegos
Relevancia
2Importante — uno de varios pilares.
ResultadoMediana de la puntuación de razonamiento diagnóstico 76 % vs. 74 % por caso (diferencia ajustada 2 puntos porcentuales, IC del 95 % −4 a 8; p=0,60); tiempo por caso 519 vs. 565 s (p=0,20). El LLM solo puntuó 16 puntos más que el grupo de recursos convencionales (IC del 95 % 2–30; p=0,03).
Goh E, et al. JAMA Netw Open. 2024;7(10):e2440969. 10.1001/jamanetworkopen.2024.40969
Discusión y crítica

La primera prueba aleatorizada de si poner un LLM en manos de los médicos mejora su razonamiento — no lo hizo, pero el LLM solo superó a ambos grupos de médicos, lo que pone al descubierto una brecha de colaboración humano-IA y no un déficit del modelo. Pequeño (50 médicos), basado en viñetas, un mes de reclutamiento y sin resultados en pacientes. Su ensayo compañero sobre el razonamiento de manejo (Goh GPT-4 (management reasoning)) encontró beneficio.