A Microsoft anunciou no Build 2026 a integração entre o Hugging Face e o Foundry Managed Compute, sua plataforma de GPU como serviço para modelos open source. A novidade chega como um catálogo curado de modelos open-weight do ecossistema Hugging Face — atualizado semanalmente — com deploy em um clique.
O que o Foundry Managed Compute oferece
O Foundry Managed Compute é a terceira opção de deployment no Microsoft Foundry, ao lado de pay-per-token e throughput provisionado. A proposta é simples: você descreve o modelo pelos parâmetros que importam para sua carga de trabalho — contagem de parâmetros, tamanho de contexto, otimização para latência ou throughput — e a Microsoft cuida da topologia de GPU, seja em um ou vários aceleradores.
Os pesos dos modelos são pré-carregados no Azure, os runtimes são compilados e escaneados pela Microsoft, e cada modelo vem com a mesma segurança enterprise, governança, observabilidade e billing que qualquer outro modelo no Foundry.
Runtimes suportados
A plataforma gerencia automaticamente atualizações de container, upgrades de runtime e patches de segurança nos seguintes runtimes, sem precisar reimplantar o modelo:
- vLLM — alta throughput para inferência
- SGLang — otimizado para structured generation
- TensorRT-LLM — aceleração NVIDIA proprietária
- NIM — NVIDIA Inference Microservices
- TEI — Text Embeddings Inference (Hugging Face)
- llama.cpp — inferência otimizada para CPU/GPU consumer
Todos compartilham um único endpoint, os mesmos SDKs (Python, C#, JavaScript, Java), a mesma autenticação e uma única fatura.
O ecossistema Hugging Face em números
O Hugging Face se consolidou como o “GitHub dos modelos open source”: 15 milhões de builders, 400 mil organizações e mais de 3 milhões de modelos publicados. Toda semana surgem novas capacidades — de coding agentivo a segmentação de vídeo, de síntese de voz a embeddings.
A integração com o Foundry significa que organizações que já usam Azure podem acessar esse ecossistema sem sair do ambiente de segurança e compliance que já conhecem.
Contexto e impacto
Este é um movimento que fecha uma lacuna importante. O Azure sempre teve forte presença enterprise, mas o ecossistema de modelos open source exigia trabalho manual de deploy e manutenção. Com o Foundry Managed Compute, modelos do Hugging Face ganham deploy gerenciado com segurança enterprise — o mesmo tratamento dado a modelos proprietários como GPT-4 e Claude.
Para empresas brasileiras que operam no Azure, a implicação é direta: testar e colocar em produção modelos open source como Llama, Mistral, DeepSeek e Qwen ficou tão simples quanto usar APIs de modelos proprietários, mas com controle total sobre os pesos e a infraestrutura.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



