Goh LLM (diagnostic reasoning)
Large Language Model Influence on Diagnostic Reasoning: A Randomized Clinical Trial
In 50 medici alle prese con vignette cliniche, l'accesso a un grande modello linguistico oltre alle risorse convenzionali non ha migliorato i punteggi di ragionamento diagnostico rispetto alle sole risorse convenzionali.
Il primo test randomizzato sul fatto che mettere un LLM in mano ai medici migliori il loro ragionamento — non è accaduto, eppure l'LLM da solo ha superato entrambi i gruppi di medici, mettendo in luce un divario nella collaborazione uomo–AI e non un deficit del modello. Piccolo (50 medici), basato su vignette, un mese di arruolamento e nessun esito sui pazienti. Lo studio gemello sul ragionamento gestionale (Goh GPT-4 (management reasoning)) ha trovato un beneficio.