GPT-5.2, Gemini e Claude Vencem OpenEvidence e UpToDate: o Benchmark da Nature Medicine e a ColisΓ£o com a CFM 2.454

GPT-5.2, Gemini e Claude Vencem OpenEvidence e UpToDate: o Benchmark da Nature Medicine e a ColisΓ£o com a CFM 2.454

Em junho, um estudo da Nature Medicine mostrou que os modelos generalistas β€” GPT-5.2, Gemini 3.1 Pro e Claude Opus 4.6 β€” superam as ferramentas clΓ­nicas dedicadas (OpenEvidence e UpToDate Expert AI) em todos os benchmarks. Dois meses depois entra em vigor a CFM 2.454, que exige rastreabilidade e mediaΓ§Γ£o humana. A ferramenta que funciona melhor Γ© justamente a que mais expΓ΅e o mΓ©dico.

Dr. Mbula Luzingu Barros | MΓ©dico Pediatra Intensivista Β· 25 anos de UTI PediΓ‘trica | Consultor em IA na SaΓΊde | Fundador da INOVAMED | Criador da Metodologia AIMED

πŸ“… Publicado em 8 de julho de 2026

⏱ VigΓͺncia da CFM 2.454 em: 49 dias β€” 26 de agosto de 2026

Por Que Este Cruzamento Importa

Em 23 de junho de 2026, a Nature Medicine publicou um dado que deveria incomodar todo gestor de saΓΊde: os modelos de IA generalistas β€” nΓ£o construΓ­dos especificamente para medicina β€” superaram as ferramentas clΓ­nicas dedicadas em todos os benchmarks testados. GPT-5.2, Gemini 3.1 Pro e Claude Opus 4.6 bateram o OpenEvidence e o UpToDate Expert AI em conhecimento, alinhamento e, sobretudo, em perguntas clΓ­nicas do mundo real.

Sessenta e quatro dias depois, o Brasil coloca em vigor a ResoluΓ§Γ£o CFM nΒΊ 2.454/2026. A pergunta que importa nΓ£o Γ© “a IA vai substituir o mΓ©dico?” β€” essa Γ© preguiΓ§osa. A pergunta que importa para quem opera no chΓ£o do hospital Γ©: o que acontece quando a ferramenta que funciona melhor Γ© exatamente a que deixa o mΓ©dico mais exposto? Esse Γ© o paradoxo que o intensivista brasileiro vai viver a partir de agosto.

O Que a Nature Medicine Mediu

O estudo comparou trΓͺs modelos de propΓ³sito geral β€” GPT-5.2 (OpenAI), Gemini 3.1 Pro (Google) e Claude Opus 4.6 (Anthropic) β€” contra duas ferramentas clΓ­nicas dedicadas e amplamente adotadas: o OpenEvidence (usado por mais de 750 mil mΓ©dicos verificados) e o UpToDate Expert AI (Wolters Kluwer). A avaliaΓ§Γ£o teve trΓͺs estΓ‘gios: 500 questΓ΅es estruturadas do MedQA (conhecimento), 500 itens do HealthBench (alinhamento) e, o mais importante, um benchmark de consultas clΓ­nicas reais (RCQ) β€” 100 perguntas desidentificadas que mΓ©dicos de fato enviaram a um modelo de linguagem em ambiente clΓ­nico ao vivo, avaliadas por 12 clΓ­nicos norte-americanos em desenho randomizado e cego, gerando 1.800 anotaΓ§Γ΅es.

Por que o terceiro estΓ‘gio muda tudo

Esse estΓ‘gio Γ© o que separa este trabalho da enxurrada de “IA passou na prova de residΓͺncia”. Prova Γ© ambiente controlado, alternativa A–D, resposta ΓΊnica. O bedside Γ© pergunta mal formulada, contexto incompleto, ambiguidade β€” o territΓ³rio onde a maioria das ferramentas quebra. E foi exatamente ali que as ferramentas dedicadas perderam por mais.

⚠ O que NΓƒO se deve concluir do paper

Benchmark nΓ£o Γ© desfecho clΓ­nico. AcurΓ‘cia em MedQA/HealthBench nΓ£o equivale a reduΓ§Γ£o de mortalidade, tempo de internaΓ§Γ£o ou erro terapΓͺutico. Γ‰ sinal de capacidade, nΓ£o prova de seguranΓ§a em deploy prospectivo. Nenhum desses nΓΊmeros autoriza uso autΓ΄nomo em decisΓ£o terapΓͺutica β€” a leitura correta Γ© sobre qual ferramenta apoia melhor, nΓ£o sobre substituir o julgamento.

Os NΓΊmeros, Sem Filtro

Ferramenta MedQA (%) HealthBench (/100) RCQ (mΓ©dia) Categoria
Gemini 3.1 Pro97,479,33,62Generalista
GPT-5.294,288,03,54Generalista
Claude Opus 4.690,277,03,52Generalista
OpenEvidence89,662,63,24Especializado
UpToDate Expert AI88,461,33,17Especializado

No MedQA a diferenΓ§a Γ© modesta. No HealthBench ela vira abismo: cerca de 26 pontos entre o melhor generalista (GPT-5.2, 88,0) e a melhor ferramenta dedicada (OpenEvidence, 62,6). E na consulta clΓ­nica real, os generalistas ficaram no topo (Gemini 3,62; GPT 3,54; Claude 3,52) contra 3,24 do OpenEvidence e 3,17 do UpToDate β€” com as ferramentas dedicadas tendo de 49% a 87% menos chance de receber a nota mais alta do clΓ­nico do que o Gemini. Detalhe que dΓ³i: nessa etapa, as ferramentas dedicadas performaram de modo comparΓ‘vel ao AI Overview do Google.

A leitura correta

NΓ£o Γ© “generalista Γ© melhor que especializado” em abstrato. Γ‰ que o produto construΓ­do e vendido para uso clΓ­nico nΓ£o sustenta superioridade justamente no tipo de pergunta que mais importa Γ  beira do leito β€” a consulta nΓ£o estruturada que chega no meio de um plantΓ£o. O selo de “ferramenta clΓ­nica dedicada”, hoje, nΓ£o Γ© garantia de melhor desempenho.

PrecisΓ£o que te blinda entre pares

Cuidado com a manchete “IA generalista vence IA com clearance do FDA”. OpenEvidence e UpToDate Expert AI sΓ£o plataformas de decisΓ£o clΓ­nica β€” nΓ£o sΓ£o, elas prΓ³prias, dispositivos mΓ©dicos registrados. O que ganhou clearance do FDA em jun/2026 foi o EchoNext (Pathway Labs), um detector de cardiopatia estrutural em ECG que a OpenEvidence passou a integrar β€” coisa distinta da ferramenta de resposta que o estudo mediu. Repetir “FDA-cleared” para o produto errado Γ© o tipo de imprecisΓ£o que um revisor atento derruba.

A CFM 2.454 na PrΓ‘tica

Publicada no DOU em 27 de fevereiro de 2026, a ResoluΓ§Γ£o entra em vigor 180 dias depois β€” em 26 de agosto de 2026. Ela nΓ£o proΓ­be IA; ela ancora responsabilidade. TrΓͺs pilares importam para quem trabalha no chΓ£o do hospital:

MediaΓ§Γ£o humana obrigatΓ³ria

Γ‰ vedado delegar Γ  IA a comunicaΓ§Γ£o de diagnΓ³sticos, prognΓ³sticos ou condutas terapΓͺuticas. O mΓ©dico revisa e valida antes de a informaΓ§Γ£o chegar ao paciente. A decisΓ£o final Γ© sempre humana.

ClassificaΓ§Γ£o por risco

Sistemas sΓ£o categorizados em baixo, mΓ©dio, alto ou inaceitΓ‘vel (Anexo II), conforme impacto em direitos fundamentais, autonomia do modelo e sensibilidade dos dados. AplicaΓ§Γ΅es de risco inaceitΓ‘vel sΓ£o simplesmente incompatΓ­veis com a norma β€” e a obrigaΓ§Γ£o de classificar Γ© da instituiΓ§Γ£o, nΓ£o do fornecedor.

Rastreabilidade no prontuΓ‘rio

O uso de IA como apoio Γ  decisΓ£o deve ser registrado, garantindo trilha auditΓ‘vel e seguranΓ§a jurΓ­dica.

Detalhe que quase ninguΓ©m leu

A ResoluΓ§Γ£o funciona tambΓ©m como escudo: o mΓ©dico nΓ£o responde por falha atribuΓ­vel exclusivamente ao sistema, desde que demonstre uso diligente, crΓ­tico e Γ©tico. Ou seja β€” o registro no prontuΓ‘rio nΓ£o Γ© burocracia, Γ© a sua proteΓ§Γ£o jurΓ­dica. Quem documenta o uso crΓ­tico da IA transfere o Γ΄nus da falha sistΓͺmica para onde ele pertence.

O Paradoxo da Ferramenta Dedicada

Junte as duas notΓ­cias e o desenho fica claro. A ferramenta que performa melhor Γ© o LLM generalista, que nΓ£o foi construΓ­do para medicina. A ferramenta com pedigree clΓ­nico β€” feita, curada e vendida para o mΓ©dico β€” Γ© justamente a que a Nature Medicine mostrou perder na consulta real. O intensivista brasileiro tende a usar o GPT-5.2 ou o Claude porque funcionam, mas o faz num vΓ‘cuo de governanΓ§a: o modelo genΓ©rico nΓ£o nasce com trilha de auditoria clΓ­nica.

⚠ O “pedigree clΓ­nico” nΓ£o Γ© garantia de superioridade

Confiar cegamente na “ferramenta feita para mΓ©dico” pode significar usar a opΓ§Γ£o que rende menos na pergunta que importa. E usar o modelo generalista superior sem registrar o uso crΓ­tico pode significar responder sozinho por uma falha que nΓ£o Γ© sua. O ponto de equilΓ­brio nΓ£o estΓ‘ em escolher entre performance e conformidade β€” estΓ‘ em construir conformidade sobre a performance.

SupervisΓ£o Significativa e Rastreabilidade

O conceito mais subestimado da resoluΓ§Γ£o Γ© o de supervisΓ£o significativa. Ele inverte o Γ΄nus da prova da seguranΓ§a: nΓ£o basta afirmar “tem humano no laΓ§o”; Γ© preciso provar que o humano tem condiΓ§Γ΅es reais de revisar β€” tempo, interface, contexto clΓ­nico e capacidade de auditar o que a IA propΓ΄s.

E aqui a evidΓͺncia da prΓ³pria Nature Medicine reforΓ§a o ponto: se o gargalo jΓ‘ nΓ£o Γ© a capacidade bruta do modelo, o diferencial passa a ser a camada de governanΓ§a em torno dele. Um chat genΓ©rico brilha na resposta, mas nΓ£o gera log clΓ­nico auditΓ‘vel por padrΓ£o. Γ‰ exatamente essa lacuna que a CFM 2.454 obriga a fechar.

A Linha do Tempo

Da publicaΓ§Γ£o da norma ao benchmark que a contradiz

Por que a coincidΓͺncia de calendΓ‘rio entre a Nature Medicine e a CFM 2.454 define a janela de decisΓ£o do mΓ©dico.

27/02/2026
CFM 2.454/2026 publicada
Aprovada em 11/02; publicada no DOU em 27/02. Vacatio legis de 180 dias.
➜
23/06/2026
Benchmark na Nature Medicine
Generalistas superam ferramentas dedicadas em conhecimento, alinhamento e consulta clΓ­nica real.
➜
Hoje Β· VocΓͺ estΓ‘ aqui
Janela de adequaΓ§Γ£o aberta
O mΓ©dico usa a melhor ferramenta sem cobertura formal. Tempo de construir a camada de rastreabilidade.
➜
26/08/2026
VigΓͺncia plena da CFM 2.454
Rastreabilidade, classificaΓ§Γ£o de risco e mediaΓ§Γ£o humana tornam-se exigΓ­veis. Uso nΓ£o documentado passa a ser nΓ£o conforme.

O Que Fazer na Segunda-Feira

Da teoria regulatΓ³ria Γ  conduta de plantΓ£o

☐
Documente todo uso de IA no prontuΓ‘rio. Modelo, versΓ£o, pergunta e sua validaΓ§Γ£o crΓ­tica. Γ‰ a sua trilha de auditoria e o seu escudo jurΓ­dico.
☐
Trate o LLM como apoio, nunca como comunicador. A fala final de diagnΓ³stico ou prognΓ³stico ao paciente e Γ  famΓ­lia Γ© sempre sua.
☐
Classifique cada uso institucional pelo risco. Baixo, mΓ©dio ou alto, com base nos critΓ©rios do Art. 12, antes de padronizar qualquer fluxo.
☐
Prefira ferramentas com trilha auditΓ‘vel e citaΓ§Γ£o de fonte. A capacidade de defesa importa tanto quanto a acurΓ‘cia.
☐
NΓ£o confunda “aprovado” com “melhor”. Exija dado de desempenho em consulta real, nΓ£o sΓ³ em prova de mΓΊltipla escolha.

Use IA no Bedside com Rigor ClΓ­nico e Cobertura RegulatΓ³ria

A metodologia AIMED forma mΓ©dicos que usam IA com rigor crΓ­tico, consciΓͺncia regulatΓ³ria e aplicaΓ§Γ£o clΓ­nica real β€” do prompt Γ  trilha no prontuΓ‘rio, com framework de implementaΓ§Γ£o e casos aplicados. Prepare-se antes de agosto.

ConheΓ§a o AIMED β†’

ConsideraΓ§Γ΅es Finais

O benchmark da Nature Medicine nΓ£o Γ© uma ameaΓ§a ao mΓ©dico brasileiro. Γ‰ um espelho. Ele mostra que a capacidade bruta migrou para o modelo generalista β€” e, por contraste, ilumina o que continua sendo nosso: o julgamento sob incerteza, a responsabilidade pelo paciente concreto e a capacidade de auditar a prΓ³pria ferramenta.

A ResoluΓ§Γ£o 2.454 nΓ£o freou o futuro; apenas exigiu que o futuro tenha um nome assinado embaixo. E esse nome, por lei e por mΓ©rito, continua sendo o do mΓ©dico.

πŸ’‘ Connecting the Dots: a CFM 2.454 amarra a proteΓ§Γ£o jurΓ­dica do mΓ©dico Γ  rastreabilidade do uso crΓ­tico, enquanto a Nature Medicine mostra que a melhor ferramenta Γ© a que menos oferece essa trilha por padrΓ£o. A vantagem competitiva do mΓ©dico-desenvolvedor estΓ‘ exatamente nessa fenda: construir a camada de rastreabilidade em torno do modelo generalista superior β€” capturar prompt, versΓ£o, resposta e validaΓ§Γ£o humana no prontuΓ‘rio β€” Γ© o que transforma a ferramenta mais capaz na ferramenta mais defensΓ‘vel. NΓ£o Γ© escolher entre performance e conformidade; Γ© engenharia de conformidade sobre a performance. Quem dominar isso primeiro define o padrΓ£o para o SUS.

ReferΓͺncias

  1. General-purpose large language models outperform specialized clinical AI tools on medical benchmarks. Nature Medicine. 2026 jun 23. DisponΓ­vel em: https://www.nature.com/articles/s41591-026-04431-5
  2. Conselho Federal de Medicina. ResoluΓ§Γ£o CFM nΒΊ 2.454, de 11 de fevereiro de 2026. DOU 2026 fev 27; Ed. 39, SeΓ§Γ£o 1, p. 158. DisponΓ­vel em: https://sistemas.cfm.org.br/normas/arquivos/resolucoes/BR/2026/2454_2026.pdf
  3. Conselho Federal de Medicina. CFM normatiza uso da IA na medicina. Portal MΓ©dico. 2026. DisponΓ­vel em: https://portal.cfm.org.br/noticias/cfm-normatiza-uso-da-ia-na-medicina/