Goh LLM (diagnostic reasoning)
Large Language Model Influence on Diagnostic Reasoning: A Randomized Clinical Trial
En 50 médicos resolviendo viñetas clínicas, el acceso a un gran modelo de lenguaje junto a los recursos convencionales no mejoró las puntuaciones de razonamiento diagnóstico en comparación con los recursos convencionales solos.
La primera prueba aleatorizada de si poner un LLM en manos de los médicos mejora su razonamiento — no lo hizo, pero el LLM solo superó a ambos grupos de médicos, lo que pone al descubierto una brecha de colaboración humano-IA y no un déficit del modelo. Pequeño (50 médicos), basado en viñetas, un mes de reclutamiento y sin resultados en pacientes. Su ensayo compañero sobre el razonamiento de manejo (Goh GPT-4 (management reasoning)) encontró beneficio.