Inteligência artificial, sem ruído.
Pesquisa e Ciência2 min

Deixar o cálculo para o código: como tornar LLMs confiáveis em calculadoras médicas

Em vez de fazer contas, o modelo escreve Python executado localmente — e melhora a confiabilidade em 1.100 casos clínicos.

Deixar o cálculo para o código: como tornar LLMs confiáveis em calculadoras médicas

Modelos de linguagem erram aritmética com frequência — e, em uma calculadora clínica, um único erro numérico muda a recomendação médica. A resposta padrão é codificar cada calculadora como uma função validada, uma a uma, o que é lento e caro. Um estudo publicado no arXiv testa um caminho alternativo: o modelo não calcula, ele escreve código.

A interface “Program-Solve”

A abordagem inverte a divisão de trabalho. Em vez de o modelo fazer a conta diretamente, ele escreve um código Python específico para o caso, que é executado por um executor local restrito e determinístico. A tarefa do modelo se reduz a decidir como usar o solver — e a aritmética fica a cargo de um ambiente determinístico, não do sampling do LLM.

Como foi avaliada

Os pesquisadores testaram a interface no benchmark MedCalc-Bench Verified, com 1.100 casos distribuídos em 55 calculadoras clínicas, usando os modelos Qwen2.5-7B e Qwen2.5-32B-AWQ. A comparação foi contra a aritmética direta do modelo e contra uma biblioteca escrita à mão com 22 calculadoras.

Um detalhe importante do trabalho: antes de avaliar, os autores auditaram as fórmulas do próprio benchmark contra as diretrizes clínicas atuais e sinalizaram 16 das 55 calculadoras com preocupações de versão, uso ou coeficiente — um alerta de que até o terreno de teste precisa de manutenção.

Por que isso importa

A promessa aqui é de confiabilidade: mover o cálculo para um executor determinístico elimina a fonte mais comum de erro em aplicações médicas de LLMs. O padrão “Program-Solve” não se limita à saúde — vale para qualquer domínio onde uma conta errada tem custo alto, de dosagem de medicamento a cálculos financeiros.

A ressalva é que o modelo ainda precisa escrever o código certo e escolher as variáveis corretas, o que não elimina todos os pontos de falha. Mas transfere o risco do ponto mais frágil (aritmética) para um ponto mais controlável (geração de código auditável).



Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.