Tradução não revistaA tradução em Português desta entrada não foi revista por pares e pode diferir da fonte. O acrónimo, o título completo e a citação mantêm-se sempre na língua original.Abrir a publicação original ↗
Goh LLM (diagnostic reasoning)
Large Language Model Influence on Diagnostic Reasoning: A Randomized Clinical Trial
Doente / População Intervenção / Exposição Comparação Desfecho
Em 50 médicos a resolver vinhetas clínicas, o acesso a um grande modelo de linguagem além dos recursos convencionais não melhorou as pontuações de raciocínio diagnóstico em comparação com recursos convencionais isolados.
N
50doentes
Desenho
RCT simples-cego, médicos aleatorizados, multicêntrico
Desfecho
Pontuação de raciocínio diagnóstico por caso numa grelha padronizada (exatidão do diagnóstico diferencial, fatores a favor/contra, próximos passos diagnósticos), classificada por consenso de peritos cegos
Relevância
2Importante — um de vários pilares.
ResultadoPontuação mediana de raciocínio diagnóstico 76 % vs. 74 % por caso (diferença ajustada 2 pontos percentuais, IC de 95 % −4 a 8; p=0,60); tempo por caso 519 vs. 565 s (p=0,20). O LLM isolado pontuou 16 pontos acima do grupo de recursos convencionais (IC de 95 % 2–30; p=0,03).
Goh E, et al. JAMA Netw Open. 2024;7(10):e2440969. 10.1001/jamanetworkopen.2024.40969
Discussão e crítica
O primeiro teste aleatorizado de se entregar um LLM aos médicos melhora o seu raciocínio — não melhorou, mas o LLM isolado superou ambos os grupos de médicos, expondo uma lacuna de colaboração humano–IA e não um défice do modelo. Pequeno (50 médicos), baseado em vinhetas, um mês de recrutamento e sem desfechos de doentes. O ensaio companheiro sobre raciocínio de orientação clínica (Goh GPT-4 (management reasoning)) encontrou benefício.