Goh LLM (diagnostic reasoning)
Large Language Model Influence on Diagnostic Reasoning: A Randomized Clinical Trial
Bei 50 Ärzten bei der Bearbeitung klinischer Fallvignetten, verbesserte der Zugang zu einem großen Sprachmodell zusätzlich zu konventionellen Ressourcen die Scores im diagnostischen Reasoning verglichen mit konventionellen Ressourcen allein nicht.
Der erste randomisierte Test, ob die Bereitstellung eines LLM das Reasoning von Ärzten verbessert — tat es nicht, doch das LLM allein übertraf beide Ärztegruppen und legte eine Lücke in der Mensch-KI-Zusammenarbeit offen statt eines Modelldefizits. Klein (50 Ärzte), vignettenbasiert, ein Monat Rekrutierung und keine Patienten-Outcomes. Die Schwesterstudie zum Management-Reasoning (Goh GPT-4 (management reasoning)) fand einen Nutzen.