Traduzione non revisionataLa traduzione in Italiano di questa voce non è stata revisionata e può differire dalla fonte. Acronimo, titolo completo e citazione restano sempre nella lingua originale.Apri la pubblicazione originale ↗

Goh LLM (diagnostic reasoning)

Large Language Model Influence on Diagnostic Reasoning: A Randomized Clinical Trial

Paziente / Popolazione Intervento / Esposizione Confronto Esito

In 50 medici alle prese con vignette cliniche, l'accesso a un grande modello linguistico oltre alle risorse convenzionali non ha migliorato i punteggi di ragionamento diagnostico rispetto alle sole risorse convenzionali.

N
50pazienti
Disegno
RCT in singolo cieco, medici randomizzati, multicentrico
Esito
Punteggio di ragionamento diagnostico per caso su una rubrica standardizzata (accuratezza della diagnosi differenziale, fattori a favore/contro, successivi passi diagnostici), valutato da un consenso di esperti in cieco
Rilevanza
2Importante — uno dei diversi pilastri.
RisultatoPunteggio mediano di ragionamento diagnostico 76 % vs. 74 % per caso (differenza aggiustata 2 punti percentuali, IC al 95 % da −4 a 8; p=0,60); tempo per caso 519 vs. 565 s (p=0,20). L'LLM da solo ha ottenuto 16 punti in più rispetto al gruppo con risorse convenzionali (IC al 95 % 2–30; p=0,03).
Goh E, et al. JAMA Netw Open. 2024;7(10):e2440969. 10.1001/jamanetworkopen.2024.40969
Discussione e critica

Il primo test randomizzato sul fatto che mettere un LLM in mano ai medici migliori il loro ragionamento — non è accaduto, eppure l'LLM da solo ha superato entrambi i gruppi di medici, mettendo in luce un divario nella collaborazione uomo–AI e non un deficit del modello. Piccolo (50 medici), basato su vignette, un mese di arruolamento e nessun esito sui pazienti. Lo studio gemello sul ragionamento gestionale (Goh GPT-4 (management reasoning)) ha trovato un beneficio.