Ungeprüfte ÜbersetzungDie Deutsche Übersetzung dieses Eintrags wurde nicht fachlich geprüft und kann vom Original abweichen. Akronym, vollständiger Titel und Zitat bleiben stets in der Originalsprache.Originalpublikation öffnen ↗

Goh GPT-4 (management reasoning)

GPT-4 Assistance for Improvement of Physician Performance on Patient Care Tasks: A Randomized Controlled Trial

Patient / Population Intervention / Exposition Vergleich Endpunkt

Bei 92 Ärzten bei der Beantwortung klinischer Fallvignetten, verbesserte GPT-4 zusätzlich zu konventionellen Ressourcen die Scores im Management-Reasoning verglichen mit konventionellen Ressourcen allein.

N
92Patienten
Design
RCT, Ärzte randomisiert, simulierte Fallvignetten
Endpunkt
Differenz des Gesamtscores zwischen den Gruppen auf von Experten entwickelten Rubriken für Management-Reasoning
Relevanz
1Praxisdefinierend — die Studie, auf der die Leitlinie ruht.
ErgebnisMittlere Differenz des Gesamtscores +6,5 % mit GPT-4 (95 %-KI 2,7–10,2; p<0,001); LLM-Nutzer benötigten 119,3 s länger pro Fall (95 %-KI 17,4–221,2; p=0,02). LLM-unterstützte Ärzte vs. LLM allein −0,9 % (95 %-KI −9,0 bis 7,2; p=0,8).
Goh E, et al. Nat Med. 2025;31(4):1233-1238. 10.1038/s41591-024-03456-y
Diskussion & Kritik

Das positive Gegenstück zur Studie zum diagnostischen Reasoning (Goh LLM (diagnostic reasoning)): Bei offenen Managementaufgaben erzielten Ärzte mit GPT-4 höhere Scores, und nicht besser als das LLM allein. Vignetten in einem simulierten Setting, per Rubrik bewertet, ohne Patienten-Outcomes — die Autoren selbst fordern eine Validierung in der realen klinischen Praxis.