Inteligência artificial, sem ruído.
Modelos e LLMs7 min

Microsoft-Decision-1: o modelo da Microsoft para decisões estruturadas em agentes

Microsoft lança modelo para classificação e controle de agentes; entenda os dados, limites e como testar com segurança.

Microsoft-Decision-1: o modelo da Microsoft para decisões estruturadas em agentes

A Microsoft anunciou em 9 de outubro de 2026 o Microsoft-Decision-1, um modelo voltado a decisões estruturadas em vez de geração de texto. A proposta é usar uma chamada curta para devolver probabilidades calibradas sobre opções previamente definidas — por exemplo, permitir, bloquear ou encaminhar uma ação de agente. O serviço está disponível no Microsoft Foundry e via OpenRouter; os pesos não foram liberados.

O ponto importante não é apenas lançar mais um modelo. Para equipes que já usam LLMs em fluxos operacionais, separar a etapa de decidir da etapa de redigir pode reduzir latência, custo e ambiguidade em classificadores, roteadores e controles de segurança. Isso também muda a forma correta de avaliar o produto: ele não foi apresentado como um substituto para chatbots ou raciocínio aberto, mas como um componente de decisão para software.

O que é o Microsoft-Decision-1

Segundo a publicação oficial da Microsoft, o Microsoft-Decision-1 foi pós-treinado a partir do Qwen3.5-9B para fazer pontuação de decisões em uma única passagem. Em vez de produzir uma resposta discursiva, recebe um contexto e um conjunto fechado de alternativas e retorna uma probabilidade para cada alternativa.

Esse formato serve a perguntas como: uma solicitação deve ser escalada para revisão humana? Qual ferramenta um agente deve chamar? Esta resposta está fundamentada na evidência fornecida? Uma ação proposta viola uma regra? A utilidade depende de o conjunto de opções ser explícito: o modelo não inventa uma nova saída textual como faria um LLM de propósito geral.

AspectoMicrosoft-Decision-1LLM generalista
Saída esperadaProbabilidades para opções fixasTexto livre, código ou chamadas de ferramenta
Casos declaradosRoteamento, classificação, verificação e controle de fluxoConversação, síntese, criação e raciocínio aberto
IntegraçãoDecisão estruturada que software pode consumir diretamenteExige interpretação, esquema de saída ou validação posterior
Limite centralNão explica nem cria alternativas fora do conjunto fornecidoMaior flexibilidade, com maior espaço para ambiguidade
Comparação funcional: modelos de decisão e LLMs atendem etapas diferentes de um sistema.

Como a Microsoft diz ter medido desempenho

A Microsoft afirma que comparou nove sistemas em 36 benchmarks, totalizando 147.137 perguntas que teriam sido mantidas fora do treinamento. Na tabela divulgada pela empresa, o modelo alcançou 83,5% de acurácia média. A companhia também informa latência mediana de 85 ms e p95 de 125 ms em sua medição ajustada pelo JevBench, além de preço de US$ 0,042 por milhão de tokens de entrada; os tokens de saída não são cobrados porque a saída é estruturada e curta.

Esses números são promissores para tarefas de alto volume, mas exigem leitura cuidadosa. São resultados divulgados pelo fornecedor, em benchmarks e condições escolhidos pelo próprio fornecedor. A comparação não prova que o modelo tomará a melhor decisão em uma política interna, um processo regulado ou um caso brasileiro específico. Antes de substituir regras ou revisão humana, uma empresa precisa testar seus próprios dados, classes de erro e custo de falsos positivos e falsos negativos.

Por que probabilidades calibradas importam para agentes

Um agente não precisa apenas escolher uma ação; precisa saber quando não tem confiança suficiente. Em um fluxo bem desenhado, uma probabilidade baixa ou pouco separada entre opções pode disparar uma rota conservadora: pedir confirmação, consultar outra fonte ou passar o caso a uma pessoa. A Microsoft cita suporte a opções de abstenção como “não é possível determinar”, além de perguntas de sim/não, múltipla escolha, escalas e avaliações por rubrica.

Isso é particularmente relevante para controles de agentes. Um LLM que planeja pode sugerir uma ação; um modelo de decisão pode avaliar se aquela ação deve ser autorizada sob regras explícitas. Nenhuma das duas camadas elimina a necessidade de permissões mínimas, registro de auditoria, isolamento de ferramentas e validação do efeito da ação. Calibração é uma propriedade estatística, não uma garantia de segurança.

Aplicações práticas para equipes no Brasil

  • Triagem de atendimento: priorizar pedidos urgentes, identificar casos que exigem humano e encaminhar cada demanda à fila adequada.
  • Roteamento de modelos: decidir se uma solicitação simples segue para um modelo menor, uma regra determinística ou um modelo mais caro.
  • Guardrails de agentes: classificar uma ação como permitida, bloqueada ou dependente de aprovação antes de chamar uma API empresarial.
  • Verificação de respostas: pontuar se uma resposta está apoiada nos documentos fornecidos, preservando a decisão e o contexto para auditoria.
  • Operações documentais: classificar formulários ou propostas por critérios previamente aprovados, desde que haja revisão humana para exceções e impacto relevante.

Para organizações sujeitas à LGPD, o ponto de partida continua sendo governança de dados: mapear quais informações entram no prompt, definir base legal e retenção, limitar dados pessoais enviados a provedores e documentar quem responde por uma decisão automatizada. Um endpoint rápido não transfere essas responsabilidades para o fornecedor.

O que a Microsoft não divulgou

A comunicação não divulga os pesos do modelo, variantes quantizadas ou requisitos para execução local. Tampouco transforma o resultado de benchmark em certificação independente. A Microsoft afirma que futuros modelos poderão ser rebased em modelos MAI e OpenAI, mas não apresentou cronograma nem detalhes de treinamento além do uso de conjuntos públicos sob seu processo Open Data e dados sintéticos.

Também há uma diferença entre acertar questões de benchmark e operar em produção. Classes raras, instruções ambíguas, mudanças de política e tentativas adversariais podem alterar substancialmente o desempenho. A própria empresa descreve testes de robustez com perturbações de enunciado e opções; isso é útil, mas não substitui uma avaliação de segurança específica para cada integração.

Como testar sem delegar decisões críticas cedo demais

  1. Defina opções e métricas antes do modelo. Especifique o que significa permitir, bloquear, escalar e abster-se; determine quais erros são mais caros.
  2. Monte um conjunto local de avaliação. Inclua casos reais anonimizados, exceções e entradas adversariais. Não use apenas exemplos fáceis ou dados que já serviram para ajustar regras.
  3. Compare com uma linha de base. Meça contra regras existentes, classificação manual e, quando fizer sentido, um LLM generalista com saída estruturada.
  4. Comece no modo de recomendação. Registre probabilidades e a decisão humana antes de liberar ações automáticas.
  5. Imponha limites externos. Mantenha autorização, escopo de ferramentas, rate limits e logs fora do modelo. Um classificador não deve ser a única barreira de uma operação irreversível.

Análise do NoticIA

O lançamento é um sinal de maturação arquitetural dos agentes: em vez de pedir que um único modelo converse, planeje, avalie e execute, fornecedores passam a separar componentes com saídas mensuráveis. A proposta pode ser especialmente atraente onde milhares de decisões repetitivas tornam um LLM generalista caro ou lento.

Mas a expressão “modelo de decisão” não deve criar uma impressão de objetividade automática. A qualidade da decisão continua limitada pelas opções fornecidas, pela política que define cada classe e pelos dados usados na avaliação. Para o mercado brasileiro, o uso mais sólido tende a ser como camada auxiliar e auditável em processos bem delimitados — e não como árbitro autônomo de crédito, emprego, saúde, segurança ou direitos de usuários.

Resumo

  • Microsoft-Decision-1 é um modelo fechado para pontuar alternativas fixas, não para gerar texto livre.
  • A Microsoft o disponibilizou no Foundry e no OpenRouter em 9 de outubro de 2026.
  • A empresa reporta 83,5% de acurácia média em 36 benchmarks e p50 de 85 ms; são métricas do fornecedor.
  • O uso mais adequado é em roteamento, classificação, verificação e controle de ações de agentes.
  • Testes locais, revisão humana para casos sensíveis e controles externos continuam indispensáveis.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.