Logotipo Afya
Anúncio
Carreira23 setembro 2026

Limites da inteligência artificial na medicina: quando não responder é mais seguro

Limites da IA na medicina expõem riscos quando modelos não reconhecem incertezas e seguem respondendo diante de informações insuficientes.
Por Ester Ribeiro

Em julho de 2026, um pastor da Flórida processou a OpenAI. Segundo a ação judicial, durante meses ele consultou um chatbot sobre sintomas que mais tarde seriam atribuídos a uma embolia pulmonar.

A petição afirma que a ferramenta minimizou repetidamente as queixas, sugeriu repouso e chegou a dizer que apenas depois de “mais oito a dez” episódios o quadro justificaria procurar atendimento médico. Dias depois, ele foi internado em uma UTI com coágulos nos dois pulmões.

Há um detalhe particularmente relevante. Nas primeiras interações, o chatbot orientava o usuário a procurar um médico. Com o passar das conversas, essas ressalvas teriam desaparecido. A ferramenta continuou respondendo, mesmo quando a única conduta realmente segura seria reconhecer seus limites e interromper a orientação.

Esse comportamento — a dificuldade de saber quando não responder — é justamente o tema de uma revisão publicada em 2026 na npj Digital Medicine. Trata-se de um problema que já saiu dos laboratórios e está, literalmente, no bolso de milhões de pacientes.

Quando responder se torna um erro

Presacan e colaboradores revisaram 28 estudos, publicados principalmente entre 2024 e 2025, sobre um conceito chamado abstention: a capacidade de um modelo de linguagem reconhecer que não deve responder.

A revisão mostra que, em diferentes benchmarks médicos, quando confrontado com perguntas sem resposta possível — por falta de informações clínicas, premissas falsas ou contexto insuficiente —, o GPT-4 frequentemente respondia em vez de admitir a incerteza.

Em alguns conjuntos de testes, a taxa de abstenção ficou próxima de apenas 10%.

Outro achado chama atenção: entre os domínios avaliados, os cenários médicos figuram entre aqueles com pior desempenho no reconhecimento de quando uma resposta deve ser retida. Em outras palavras, justamente onde o erro pode custar vidas é onde os modelos menos sabem dizer “não sei”.

A revisão reúne outros exemplos preocupantes. Em cenários eticamente sensíveis, o ChatGPT-3.5 praticamente nunca recusou responder, enquanto o GPT-4 apresentou taxas de recusa em torno de 16%.

Em um benchmark de oftalmologia, a incapacidade de se abster respondeu por cerca de 18% dos erros diagnósticos relacionados ao glaucoma. Já em tarefas de verificação de informações em saúde, diferentes modelos tenderam a aceitar ou reforçar alegações falsas em vez de questioná-las.

Leia também: ACP 2026 aborda a inteligência artificial na medicina entre precisão e risco de viés.

Por que os modelos têm dificuldade para se calar?

A explicação é estrutural, não moral. Modelos de linguagem foram treinados para produzir texto plausível. Seu objetivo principal é continuar a conversa, e não avaliar de forma confiável os limites do próprio conhecimento.

Embora consigam estimar probabilidades, esses sistemas ainda não possuem mecanismos robustos para calibrar a própria incerteza clínica. Esse fenômeno está intimamente ligado às chamadas “alucinações”, nas quais o modelo produz uma resposta convincente mesmo sem base suficiente para sustentá-la.

Há ainda outro aspecto importante. Estudos recentes mostram que esses sistemas apresentam uma tendência conhecida como sycophancy: uma inclinação a concordar com as premissas do usuário e adaptar a resposta ao contexto da conversa.

Em interações prolongadas, isso pode levar o modelo a reforçar hipóteses equivocadas em vez de desafiá-las. Um paciente que busca confirmação para a ideia de que “não é nada grave” pode acabar recebendo respostas que reforcem essa percepção, especialmente quando a conversa se estende por muitas mensagens sem supervisão profissional.

Leia também: Pesquisa mostra que médicos já usam IA na saúde, mas ainda temem erros clínicos.

Dois motivos para uma inteligência artificial não responder

Um dos méritos da revisão é mostrar que “não responder” nem sempre significa a mesma coisa. Os autores distinguem dois tipos de abstenção.

Abstenção epistêmica: quando faltam informações

Na abstenção epistêmica, o modelo não dispõe das informações necessárias para responder.

Pode faltar a idade do paciente, o exame físico, resultados de exames complementares ou outros elementos do contexto clínico. Em determinadas situações, o próprio problema pode não admitir uma resposta única.

É, essencialmente, um “não sei”.

Abstenção normativa: quando responder ultrapassa limites

Na abstenção normativa, o modelo pode até possuir conhecimento suficiente, mas responder violaria limites éticos, legais ou profissionais.

É o “não devo responder”.

Embora produzam o mesmo comportamento — interromper a resposta —, essas duas situações exigem mecanismos diferentes de identificação.

A revisão mostra que praticamente todas as estratégias atuais utilizam soluções externas ao modelo, como filtros adicionais, classificadores auxiliares ou engenharia de prompts. Nenhum dos estudos analisados encontrou modelos cuja capacidade de reconhecer os próprios limites tivesse sido incorporada desde o pré-treinamento.

O silêncio da inteligência artificial também pode causar danos

Talvez a contribuição mais relevante do artigo seja lembrar que o silêncio também pode causar danos. Responder nem sempre é melhor, mas também não é desejável que um sistema se recuse a responder qualquer pergunta.

Os autores descrevem essa decisão como um equilíbrio entre benefícios e riscos: responder só vale a pena quando o benefício esperado supera a probabilidade de erro, o dano potencial da resposta e o custo de permanecer em silêncio.

Desse equilíbrio surgem duas formas opostas de falha.

Sub-recusa

A sub-recusa, ou under-abstention, ocorre quando o sistema responde mesmo quando deveria admitir incerteza, pedir mais informações ou encaminhar o paciente para avaliação profissional.

Super-recusa

A super-recusa, ou over-abstention, ocorre quando o sistema deixa de responder perguntas seguras e úteis por excesso de cautela.

Segundo os autores, avaliar apenas a acurácia dos modelos é insuficiente. Também é necessário medir se eles reconhecem o momento adequado para interromper uma resposta.

O que os limites da inteligência artificial mudam na prática clínica?

Perguntar sobre o uso de chatbots durante a anamnese

A primeira consequência é incorporar uma pergunta que raramente fazemos na anamnese:

“Você pesquisou esses sintomas antes de vir? O que a ferramenta respondeu?”

Essa informação pode mudar a interpretação da consulta. O paciente tranquilizado por um chatbot pode demorar mais para procurar atendimento. Já aquele assustado por respostas alarmistas pode chegar ao consultório excessivamente ansioso.

Em ambos os casos, compreender essa influência ajuda a interpretar melhor a história clínica.

Avaliar o efeito de conversas prolongadas

A segunda consequência diz respeito às conversas prolongadas.

Quando um paciente relata semanas ou meses discutindo o mesmo problema com uma inteligência artificial, vale lembrar que a resposta inicial pode não ser a mesma que sustentou toda a conversa.

Em interações longas, o contexto acumulado modifica o comportamento do modelo, e as ressalvas iniciais podem desaparecer.

Incluir a capacidade de abstenção na avaliação institucional

A terceira consequência é institucional. Ao avaliar ferramentas de apoio à decisão clínica, não basta perguntar qual é sua acurácia.

Também é importante analisar como elas se comportam diante de informações incompletas:

  • solicitam os dados que faltam?
  • reconhecem a própria incerteza?
  • orientam o usuário a procurar avaliação médica?
  • ou simplesmente produzem uma resposta?

Um sistema que acerta muito, mas nunca admite seus limites, pode representar um risco maior do que outro ligeiramente menos preciso, porém capaz de reconhecer quando deve parar.

Leia também: Entenda como a IA pode apoiar a prática clínica com segurança.

O que o artigo ainda não resolve

Os próprios autores reconhecem as limitações do trabalho.

Como demonstração prática, eles propõem o MedSAFE, um framework composto por três agentes: um simula o paciente, outro representa o modelo avaliado e um terceiro julga o diálogo segundo critérios padronizados.

Trata-se, porém, de uma prova de conceito. O método foi testado em apenas oito cenários sintéticos e ainda depende de avaliadores simulados. Não se trata de um benchmark validado.

Além disso, alguns cenários mostraram que distinguir entre uma recusa inadequada e uma resposta cautelosa continua sendo um desafio.

Curiosamente, essa também é uma habilidade que médicos levam anos para desenvolver durante a formação.

Leia também: IA assistiva no cuidado ao paciente: apoio útil ou atalho perigoso?.

Reconhecer limites também é um sinal de competência

A principal mensagem da revisão é simples: a capacidade de se abster não deve ser vista como uma limitação da inteligência artificial, mas como um sinal de competência.

Os melhores especialistas não respondem tudo. Eles reconhecem quando a informação é insuficiente, sabem quando pedir mais dados e quando encaminhar. Sabem dizer:

“Não tenho certeza. Precisamos investigar melhor.”

Todo preceptor experiente reconhece rapidamente a diferença entre o interno que improvisa uma resposta e aquele que admite seus limites e procura ajuda.

Esperar esse mesmo comportamento de uma ferramenta de apoio clínico não parece uma exigência exagerada. Parece apenas aplicar às máquinas o mesmo padrão que já esperamos dos profissionais de saúde.

Quando um algoritmo responde além do que sabe, a responsabilidade costuma ser difusa. Quando um médico faz o mesmo, há um nome no prontuário.

Essa diferença não é apenas jurídica. Ela ajuda a definir o que significa exercer uma profissão.

#Conteúdo otimizado com o auxílio de IA e revisado pela equipe do Portal Afya.

Autoria

Foto de Ester Ribeiro

Ester Ribeiro

Editora médica na Afya. Médica pela Pontifícia Universidade Católica de Campinas (PUC-Camp), com residência médica em Clínica Médica e Nefrologia pelo Hospital Santa Marcelina (2016). Além da atuação na Afya, também atenda em consultório particular e clínica de diálise.

Como você avalia este conteúdo?

Sua opinião ajudará outros médicos a encontrar conteúdos mais relevantes.

Compartilhar artigo

Referências bibliográficas

Newsletter

Aproveite o benefício de manter-se atualizado sem esforço.

Anúncio

Leia também em Carreira