Inteligência artificial, sem ruído.
Pesquisa e Ciência2 min

Modelos de IA financeira têm desempenho desigual entre tarefas de revisão de risco

Estudo com 9.742 instâncias mostra que pontuações amplas não preveem o desempenho em tarefas específicas de compliance e risco.

Modelos de IA financeira têm desempenho desigual entre tarefas de revisão de risco

Um novo pré-print questiona a prática de escolher modelos de IA financeira apenas por pontuações gerais de capacidade. O estudo FinRiskAtlas mostra que o desempenho varia de forma significativa entre as tarefas específicas de revisão de risco e compliance — e que um ranking amplo pode levar à escolha errada de modelo.

Uma pontuação não resolve a escolha

O FinRiskAtlas reúne 9.742 instâncias estáticas em 53 famílias de tarefas: 42 de conhecimento de domínio e 11 de operações “downstream”, definidas em torno de entregas concretas de revisão sob condições específicas de evidência.

Os rankings das operações downstream ficaram apenas parcialmente alinhados: a correlação média de Spearman entre pares foi de 0,42, e 37 dos 55 pares de operações tiveram correlação abaixo de 0,5. Um modelo bem ranqueado para um tipo de revisão pode, portanto, ir mal em outro.

O custo de escolher errado

O estudo também mediu o “arrependimento” de usar pontuações amplas para pré-selecionar modelos. Quando apenas um modelo era selecionado, a diferença observada para a melhor configuração disponível foi de 18,01 pontos em extração de informação, 11,21 pontos em raciocínio quantitativo e 8,47 pontos em previsão de desfechos legais. Mesmo com uma lista de 15 modelos, a geração de “visão de decisão” ainda deixava 6,70 pontos na mesa.

As avaliações cobriram 33 configurações de modelo, usando respostas zero-shot diretas, sem exemplos no contexto e sem cadeia de pensamento. Uma extensão, o FinRisk-Ask, testa ainda quando o modelo pede mais evidência em vez de prosseguir com o material disponível.

Para bancos, fintechs e equipes de compliance que avaliam a adoção de LLMs, o recado é direto: a seleção deve ser feita por tarefa, com contratos de avaliação bem definidos — não por um placar agregado de “capacidade financeira”.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.