Goh LLM (diagnostic reasoning)
Large Language Model Influence on Diagnostic Reasoning: A Randomized Clinical Trial
Chez 50 médecins travaillant sur des vignettes cliniques, l'accès à un grand modèle de langage en plus des ressources conventionnelles n'a pas amélioré les scores de raisonnement diagnostique par rapport aux ressources conventionnelles seules.
Premier test randomisé de la question de savoir si confier un LLM aux médecins améliore leur raisonnement — ce ne fut pas le cas, alors que le LLM seul a surpassé les deux groupes de médecins, révélant un déficit de collaboration humain–IA plutôt qu'un déficit du modèle. Petit effectif (50 médecins), fondé sur des vignettes, un mois de recrutement et aucun résultat patient. Son essai compagnon sur le raisonnement de prise en charge (Goh GPT-4 (management reasoning)) a trouvé un bénéfice.