Inteligência artificial, sem ruído.
Open Source7 min

Cloudflare lança Clef e Clef-flash, modelos abertos para decisões estruturadas em agentes

Clef e Clef-flash transformam texto, JSON, imagens e vídeo em decisões tipadas com probabilidades. Entenda ganhos, limites e uso responsável.

Cloudflare lança Clef e Clef-flash, modelos abertos para decisões estruturadas em agentes

A Cloudflare lançou em 1º de outubro de 2026 os modelos abertos Clef e Clef-flash para uma tarefa específica: transformar um estado — texto, JSON, imagens ou vídeo — em decisões estruturadas com probabilidades, sem gerar uma resposta em linguagem natural. A proposta é deslocar classificações recorrentes de fluxos de agentes para um modelo especializado, com pesos Apache 2.0, hospedagem no Workers AI e compatibilidade com a API Jev/SystemOne.

Em vez de pedir a um modelo de linguagem que explique se um chamado é urgente e depois interpretar sua resposta, uma aplicação pode enviar o chamado e um esquema de perguntas. O resultado devolve, por exemplo, a probabilidade de urgência, a equipe responsável e uma nota de severidade. Essa diferença parece pequena, mas muda a parte mais sensível de um agente: a passagem entre entender o contexto e acionar uma ferramenta, uma fila ou uma revisão humana.

O que são Clef e Clef-flash

Cloudflare descreve Clef como um modelo multimodal de 27 bilhões de parâmetros e Clef-flash como a variante menor, baseada em um modelo de 9 bilhões de parâmetros. Ambos aceitam estado em texto ou dados estruturados; o Clef também preserva o codificador visual do modelo-base, permitindo avaliar imagens e vídeo quando esses materiais fazem parte do registro.

Os dois não foram projetados para substituir um LLM geral. Um LLM é adequado quando a aplicação precisa redigir, resumir, pesquisar possibilidades ou montar uma chamada de ferramenta. Um modelo de decisão serve para uma pergunta delimitada: este pagamento parece fraudulento?, qual equipe deve receber este incidente?, o pedido exige escalonamento?. A saída é limitada aos valores que o desenvolvedor definiu, o que reduz a necessidade de extrair JSON de texto gerado.

Como a saída estruturada funciona

O esquema do Clef tem três tipos principais de pergunta. noul devolve uma decisão verdadeira/falsa com probabilidade; choice escolhe entre opções nomeadas e informa probabilidades por opção; score avalia uma escala ordenada. Uma única solicitação pode carregar várias perguntas sobre o mesmo estado. Essa combinação é relevante porque a decisão de uma fila de suporte, por exemplo, não é composta apenas por “urgente ou não”: ela também pode depender de produto, impacto e necessidade de intervenção humana.

Segundo a documentação e o cartão do modelo, o backbone faz uma passagem de pré-preenchimento sobre o contexto e o esquema. Em seguida, uma cabeça de esquema conjunta pontua as opções permitidas. O modelo não precisa escrever uma cadeia de texto antes de devolver o resultado. A Cloudflare afirma que esse caminho não autorregressivo é a razão de sua adequação para classificações no “caminho quente” de um agente, onde cada centena de milissegundos se soma a chamadas de ferramentas subsequentes.

O que os benchmarks mostram — e o que não mostram

Métrica declarada pela CloudflareClefClef-flashJev
Latência mediana209,3 ms38,8 ms524,1 ms
Latência p95238,6 ms122,4 ms536,0 ms
BANKING77 (macro-F1)94,290,979,7
GPQA Diamond (acurácia)48,051,078,3
Resultados divulgados no cartão do modelo; não são uma replicação independente.

Os números ajudam a delimitar o produto. Nos testes divulgados, Clef e Clef-flash obtêm bons resultados em tarefas de classificação, roteamento e chamadas de ferramentas. Já em avaliações de conhecimento e raciocínio geral, como GPQA Diamond e MMLU-Pro, o Jev supera as variantes da Cloudflare em várias medições. Não é uma contradição: uma ferramenta especializada pode ser mais rápida e mais previsível no seu esquema, mas não necessariamente é a melhor escolha para perguntas abertas.

A Cloudflare também relata um teste interno em inteligência de ameaças: classificar um domínio com obtenção, renderização e análise teria levado 2,2 segundos no Clef, contra 4,7 segundos no gpt-oss-120b. Esse é um caso de uso da própria empresa, não uma garantia de desempenho para outro ambiente. Latência real dependerá do tamanho do estado, da região, do tráfego, da consulta e do desenho da integração.

Disponibilidade, licença e integração

Os pesos foram publicados no Hugging Face sob Apache 2.0. A Cloudflare também oferece os modelos no Workers AI. A compatibilidade com Jev/SystemOne importa para equipes que já modelaram suas decisões nesse formato: em tese, a migração pode se limitar ao endpoint e ao nome do modelo, preservando o corpo de perguntas. Ainda assim, compatibilidade de API não elimina a necessidade de revalidar limiares de confiança, cobertura de classes e tratamento de erro.

Para ajuste fino, a empresa anunciou inicialmente um serviço assistido por engenheiros de campo, com a intenção de criar uma opção self-service depois. A arquitetura proposta combina AI Gateway para capturar dados de fluxo, Workers AI para gerar execuções, Containers para o ambiente de reforço e um componente Trainer para atualizar os pesos. Nenhuma dessas etapas transforma dados de produção em um conjunto seguro por si só: equipes precisam definir retenção, base legal, anonimização e revisão das decisões usadas como rótulo.

Impacto prático para equipes brasileiras

O caso mais plausível não é trocar um chatbot por Clef, mas separar responsabilidades. Um e-commerce pode usar um LLM para entender uma mensagem longa e um modelo de decisão para escolher a fila, validar políticas e decidir quando interromper a automação. Uma operação de segurança pode classificar alertas de domínios e anexos; uma central de atendimento pode estimar urgência e encaminhamento. Em todos os casos, o ganho vem de respostas com formato estável, não da promessa de autonomia irrestrita.

Para empresas brasileiras, há uma segunda camada de cuidado: decisões sobre crédito, contratação, saúde, fraude ou moderação podem produzir efeitos relevantes sobre pessoas. Probabilidade não é explicação nem autorização para automatizar uma decisão de alto impacto. A melhor implantação começa por sugestões auditáveis, limites de confiança conservadores, registro de evidências e rota de revisão humana. Também é necessário verificar onde os dados são processados e se o fluxo atende às obrigações aplicáveis da LGPD.

Limitações que não devem ser escondidas

  • As comparações foram divulgadas pela própria Cloudflare; faltam replicações independentes e testes em português brasileiro.
  • Saída tipada reduz erros de parsing, mas não garante que a classificação esteja correta ou bem calibrada para dados locais.
  • Um esquema ruim apenas torna uma decisão ruim mais rápida. Classes, critérios e limiares precisam ser testados com casos reais.
  • Pesos abertos não significam operação barata: o cartão do Clef cita testes com uma H200 para execução local.

Análise do NoticIA

O lançamento é mais interessante pelo recorte do que pelo tamanho do modelo. A corrida de agentes costuma enfatizar modelos que planejam e escrevem; Clef tenta resolver a camada repetitiva de decisão que conecta esse planejamento a uma ação concreta. Se esse padrão se consolidar, arquiteturas de agentes deverão usar menos um único modelo “faz tudo” e mais uma composição: LLM para interpretação aberta, modelo de decisão para roteamento e regras explícitas para o que não pode ser delegado.

O teste decisivo não é saber se Clef vence uma tabela específica, mas se mantém calibração, observabilidade e reversibilidade em produção. Para operações que já possuem rótulos confiáveis e alto volume de triagem, esse é um caminho tecnicamente promissor. Para equipes sem dados de avaliação e sem governança, adicionar um modelo especializado pode apenas ocultar a incerteza atrás de um número de confiança.



Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.