Traduction non vérifiéeLa traduction en Français de cette entrée n'a pas été vérifiée par les pairs et peut différer de la source. L'acronyme, le titre complet et la citation restent toujours dans la langue d'origine.Ouvrir la publication d'origine ↗
Goh GPT-4 (management reasoning)
GPT-4 Assistance for Improvement of Physician Performance on Patient Care Tasks: A Randomized Controlled Trial
Patient / Population Intervention / Exposition Comparaison Critère de jugement
Chez 92 médecins répondant à des vignettes cliniques, GPT-4 en plus des ressources conventionnelles a amélioré les scores de raisonnement de prise en charge par rapport aux ressources conventionnelles seules.
N
92patients
Schéma
RCT, médecins randomisés, vignettes simulées
Critère
Différence de score total entre les groupes sur des grilles de raisonnement de prise en charge élaborées par des experts
Pertinence
1Structure la pratique — l’essai sur lequel repose la recommandation.
RésultatDifférence moyenne de score total +6,5 % avec GPT-4 (IC à 95 % 2,7–10,2 ; p<0,001) ; les utilisateurs du LLM ont passé 119,3 s de plus par cas (IC à 95 % 17,4–221,2 ; p=0,02). Médecins augmentés par le LLM vs. LLM seul −0,9 % (IC à 95 % −9,0 à 7,2 ; p=0,8).
Goh E, et al. Nat Med. 2025;31(4):1233-1238. 10.1038/s41591-024-03456-y
Discussion et critique
Le pendant positif de l'essai sur le raisonnement diagnostique (Goh LLM (diagnostic reasoning)) : sur des tâches ouvertes de prise en charge, les médecins équipés de GPT-4 ont obtenu de meilleurs scores, et pas meilleurs que le LLM seul. Vignettes en contexte simulé notées sur grille, sans résultat patient — les auteurs eux-mêmes appellent à une validation en pratique clinique réelle.