Ungeprüfte ÜbersetzungDie Deutsche Übersetzung dieses Eintrags wurde nicht fachlich geprüft und kann vom Original abweichen. Akronym, vollständiger Titel und Zitat bleiben stets in der Originalsprache.Originalpublikation öffnen ↗

Goh LLM (diagnostic reasoning)

Large Language Model Influence on Diagnostic Reasoning: A Randomized Clinical Trial

Patient / Population Intervention / Exposition Vergleich Endpunkt

Bei 50 Ärzten bei der Bearbeitung klinischer Fallvignetten, verbesserte der Zugang zu einem großen Sprachmodell zusätzlich zu konventionellen Ressourcen die Scores im diagnostischen Reasoning verglichen mit konventionellen Ressourcen allein nicht.

N
50Patienten
Design
Einfach verblindete RCT, Ärzte randomisiert, multizentrisch
Endpunkt
Score für diagnostisches Reasoning pro Fall auf einer standardisierten Rubrik (Treffsicherheit der Differenzialdiagnose, stützende/widersprechende Faktoren, nächste diagnostische Schritte), bewertet durch verblindeten Expertenkonsens
Relevanz
2Wichtig — eine von mehreren Säulen.
ErgebnisMedianer Score für diagnostisches Reasoning 76 % vs. 74 % pro Fall (adjustierte Differenz 2 Prozentpunkte; 95 %-KI −4 bis 8; p=0,60); Zeit pro Fall 519 vs. 565 s (p=0,20). Das LLM allein erzielte 16 Punkte mehr als die Gruppe mit konventionellen Ressourcen (95 %-KI 2–30; p=0,03).
Goh E, et al. JAMA Netw Open. 2024;7(10):e2440969. 10.1001/jamanetworkopen.2024.40969
Diskussion & Kritik

Der erste randomisierte Test, ob die Bereitstellung eines LLM das Reasoning von Ärzten verbessert — tat es nicht, doch das LLM allein übertraf beide Ärztegruppen und legte eine Lücke in der Mensch-KI-Zusammenarbeit offen statt eines Modelldefizits. Klein (50 Ärzte), vignettenbasiert, ein Monat Rekrutierung und keine Patienten-Outcomes. Die Schwesterstudie zum Management-Reasoning (Goh GPT-4 (management reasoning)) fand einen Nutzen.