Traduzione non revisionataLa traduzione in Italiano di questa voce non è stata revisionata e può differire dalla fonte. Acronimo, titolo completo e citazione restano sempre nella lingua originale.Apri la pubblicazione originale ↗

Goh GPT-4 (management reasoning)

GPT-4 Assistance for Improvement of Physician Performance on Patient Care Tasks: A Randomized Controlled Trial

Paziente / Popolazione Intervento / Esposizione Confronto Esito

In 92 medici che rispondevano a vignette cliniche, GPT-4 oltre alle risorse convenzionali ha migliorato i punteggi di ragionamento gestionale rispetto alle sole risorse convenzionali.

N
92pazienti
Disegno
RCT, medici randomizzati, vignette simulate
Esito
Differenza di punteggio totale tra i gruppi su rubriche di ragionamento gestionale sviluppate da esperti
Rilevanza
1Definisce la pratica — lo studio su cui poggia la linea guida.
RisultatoDifferenza media del punteggio totale +6,5 % con GPT-4 (IC al 95 % 2,7–10,2; p<0,001); gli utilizzatori dell'LLM hanno impiegato 119,3 s in più per caso (IC al 95 % 17,4–221,2; p=0,02). Medici potenziati dall'LLM vs. LLM da solo −0,9 % (IC al 95 % da −9,0 a 7,2; p=0,8).
Goh E, et al. Nat Med. 2025;31(4):1233-1238. 10.1038/s41591-024-03456-y
Discussione e critica

La controparte positiva dello studio sul ragionamento diagnostico (Goh LLM (diagnostic reasoning)): in compiti gestionali a risposta aperta i medici con GPT-4 hanno ottenuto punteggi più alti, e non migliori dell'LLM da solo. Vignette in un contesto simulato valutate con rubrica, senza esiti sui pazienti — gli stessi autori chiedono una validazione nella pratica clinica reale.