Tradução não revistaA tradução em Português desta entrada não foi revista por pares e pode diferir da fonte. O acrónimo, o título completo e a citação mantêm-se sempre na língua original.Abrir a publicação original ↗
Goh GPT-4 (management reasoning)
GPT-4 Assistance for Improvement of Physician Performance on Patient Care Tasks: A Randomized Controlled Trial
Doente / População Intervenção / Exposição Comparação Desfecho
Em 92 médicos a responder a vinhetas clínicas, GPT-4 além dos recursos convencionais melhorou as pontuações de raciocínio de orientação clínica em comparação com recursos convencionais isolados.
N
92doentes
Desenho
RCT, médicos aleatorizados, vinhetas simuladas
Desfecho
Diferença de pontuação total entre grupos em grelhas de raciocínio de orientação clínica desenvolvidas por peritos
Relevância
1Define a prática — o ensaio em que a diretriz assenta.
ResultadoDiferença média da pontuação total +6,5 % com GPT-4 (IC de 95 % 2,7–10,2; p<0,001); os utilizadores do LLM gastaram mais 119,3 s por caso (IC de 95 % 17,4–221,2; p=0,02). Médicos aumentados pelo LLM vs. LLM isolado −0,9 % (IC de 95 % −9,0 a 7,2; p=0,8).
Goh E, et al. Nat Med. 2025;31(4):1233-1238. 10.1038/s41591-024-03456-y
Discussão e crítica
A contrapartida positiva do ensaio de raciocínio diagnóstico (Goh LLM (diagnostic reasoning)): em tarefas abertas de orientação clínica, os médicos com GPT-4 pontuaram mais alto, e não melhor do que o LLM isolado. Vinhetas em contexto simulado classificadas por grelha, sem desfechos de doentes — os próprios autores pedem validação na prática clínica real.