TrialsgrambêtaRCTs are beautiful
Traduction non vérifiéeLa traduction en Français de cette entrée n'a pas été vérifiée par les pairs et peut différer de la source. L'acronyme, le titre complet et la citation restent toujours dans la langue d'origine.Ouvrir la publication d'origine ↗

Goh LLM (diagnostic reasoning)

Large Language Model Influence on Diagnostic Reasoning: A Randomized Clinical Trial

Patient / Population Intervention / Exposition Comparaison Critère de jugement

Chez 50 médecins travaillant sur des vignettes cliniques, l'accès à un grand modèle de langage en plus des ressources conventionnelles n'a pas amélioré les scores de raisonnement diagnostique par rapport aux ressources conventionnelles seules.

N
50patients
Schéma
RCT en simple aveugle, médecins randomisés, multicentrique
Critère
Score de raisonnement diagnostique par cas sur une grille standardisée (exactitude du diagnostic différentiel, éléments en faveur/en défaveur, étapes diagnostiques suivantes), noté par consensus d'experts en aveugle
Pertinence
2Important — l’un des piliers parmi d’autres.
RésultatScore médian de raisonnement diagnostique 76 % vs. 74 % par cas (différence ajustée 2 points de pourcentage, IC à 95 % −4 à 8 ; p=0,60) ; temps par cas 519 vs. 565 s (p=0,20). Le LLM seul a obtenu 16 points de plus que le groupe ressources conventionnelles (IC à 95 % 2–30 ; p=0,03).
Goh E, et al. JAMA Netw Open. 2024;7(10):e2440969. 10.1001/jamanetworkopen.2024.40969
Discussion et critique

Premier test randomisé de la question de savoir si confier un LLM aux médecins améliore leur raisonnement — ce ne fut pas le cas, alors que le LLM seul a surpassé les deux groupes de médecins, révélant un déficit de collaboration humain–IA plutôt qu'un déficit du modèle. Petit effectif (50 médecins), fondé sur des vignettes, un mois de recrutement et aucun résultat patient. Son essai compagnon sur le raisonnement de prise en charge (Goh GPT-4 (management reasoning)) a trouvé un bénéfice.