A Tencent acaba de lançar o Hy3, um modelo de linguagem Mixture-of-Experts (MoE) com 295 bilhões de parâmetros totais que ativa apenas 21 bilhões por token. Os pesos estão sob licença Apache 2.0 — totalmente abertos para uso comercial e pesquisa — e o contexto chega a 256K tokens, colocando o Hy3 entre os modelos open source mais capazes para tarefas de raciocínio, agentes e processamento de documentos longos.
Arquitetura e eficiência
O Hy3 utiliza uma arquitetura MoE esparsa com 192 especialistas e roteamento top-8: a cada token, apenas 8 especialistas são ativados. Isso mantém o custo computacional baixo apesar do tamanho total do modelo. Além do MoE, o Hy3 incorpora Multi-Token Prediction (MTP), uma camada que prevê vários tokens de uma vez para decodificação mais rápida. Tanto vLLM quanto SGLang ativam o MTP via speculative decoding.
A Tencent também publicou um checkpoint Hy3-FP8, que reduz ainda mais o footprint de memória para servir o modelo com menor custo. Para deploy, a recomendação oficial são 8 GPUs como H20-3e, usando vLLM ou SGLang com MTP habilitado.
Benchmarks: força em código, STEM e agentes
Os números publicados pela equipe de pesquisa mostram um modelo competitivo em múltiplas frentes:
| Área | Benchmark | Hy3 |
|---|---|---|
| Código | SWE-Bench Verified | 78.0 |
| Código | SWE-Bench Pro | 57.9 |
| Código | SWE-Bench Multilingual | 75.8 |
| Código | Terminal-Bench 2.1 | 71.7 |
| STEM | GPQA Diamond | 90.4 |
| Matemática | USAMO 2026 | 72.0 |
| Matemática | IMOAnswerBench | 90.0 |
| Raciocínio | HLE (com ferramentas) | 53.2 |
Em um teste cego com 270 especialistas e 312 comparações em fluxos reais de trabalho, o Hy3 marcou 2.67 de 4 pontos, à frente do GLM-5.1 (2.51). A vantagem foi mais clara em desenvolvimento frontend, CI/CD e dados e armazenamento.
Confiabilidade em produção: menos alucinações, melhor tracking
A equipe da Tencent focou em três modos de falha que costumam quebrar agentes em produção:
- Tool calling estável: correções de baseline reduziram loops infinitos causados por chamadas inválidas. A variância de acurácia entre scaffolds (CodeBuddy, Cline, KiloCode) ficou dentro de 4% no SWE-Bench Verified.
- Anti-alucinação: a taxa de alucinação caiu de 12.5% para 5.4% em avaliações internas. Erros de conhecimento de senso comum caíram de 25.4% para 12.7%.
- Rastreamento de intenção multi-turno: SFT e RL conjuntos reduziram a taxa de erro interno de 17.4% para 7.9%. No benchmark MRCR de diálogos longos, a pontuação subiu de 42.9% para 75.1%.
API compatível com OpenAI e acesso gratuito
O Hy3 expõe uma API compatível com OpenAI — basta apontar o cliente para o endpoint local. Um parâmetro reasoning_effort controla o nível de raciocínio: "no_think" para respostas diretas, "low" para tarefas moderadas e "high" para matemática, código ou tarefas multi-etapa.
Para quem não quer rodar localmente, o OpenRouter oferece uma rota gratuita (tencent/hy3:free) a $0 por token, disponível até 21 de julho de 2026.
Casos de uso práticos
- Agentes de código: alimente um repositório inteiro na janela de 256K e peça para corrigir testes com
reasoning_effort="high". - Processamento de documentos: contratos longos ou filings como contexto, com o treinamento anti-alucinação reduzindo cláusulas fabricadas.
- Análise financeira: combine tabelas e prosa em um prompt e peça um resumo fundamentado que sinalize dados ausentes.
- Desenvolvimento frontend: gere componentes React ou game loops — o teste cego mostrou vantagem sobre GLM-5.1 nesta área.
O que o Hy3 não é
É importante contextualizar: nos benchmarks de código, o GLM-5.2 (~744B MoE, ~40B ativos) lidera. O Hy3 troca alguma acurácia em código por um footprint ativo muito menor — 21B contra ~40B. Para quem faz self-host e paga por GPU, essa diferença de tamanho é relevante. Além disso, os 295B totais exigem infraestrutura significativa: 8 GPUs de datacenter não são triviais para times pequenos.
Disponibilidade
- Pesos: Hugging Face — tencent/Hy3
- Código: repositório no GitHub da Tencent
- API gratuita: OpenRouter (
tencent/hy3:free) até 21/07/2026 - Ferramentas: AngelSlim para quantização e fine-tuning
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



