Inteligência artificial, sem ruído.
Modelos e LLMs4 min

Tencent Lança Hy3: Modelo Open Source de 295B com 21B Parâmetros Ativos e 256K de Contexto

Tencent lança Hy3, modelo MoE de 295B com 21B ativos, 256K de contexto e licença Apache 2.0. Benchmark competitivo em código, STEM e agentes, com foco em confiabilidade para produção.

Tencent Lança Hy3: Modelo Open Source de 295B com 21B Parâmetros Ativos e 256K de Contexto

A Tencent acaba de lançar o Hy3, um modelo de linguagem Mixture-of-Experts (MoE) com 295 bilhões de parâmetros totais que ativa apenas 21 bilhões por token. Os pesos estão sob licença Apache 2.0 — totalmente abertos para uso comercial e pesquisa — e o contexto chega a 256K tokens, colocando o Hy3 entre os modelos open source mais capazes para tarefas de raciocínio, agentes e processamento de documentos longos.

Arquitetura e eficiência

O Hy3 utiliza uma arquitetura MoE esparsa com 192 especialistas e roteamento top-8: a cada token, apenas 8 especialistas são ativados. Isso mantém o custo computacional baixo apesar do tamanho total do modelo. Além do MoE, o Hy3 incorpora Multi-Token Prediction (MTP), uma camada que prevê vários tokens de uma vez para decodificação mais rápida. Tanto vLLM quanto SGLang ativam o MTP via speculative decoding.

A Tencent também publicou um checkpoint Hy3-FP8, que reduz ainda mais o footprint de memória para servir o modelo com menor custo. Para deploy, a recomendação oficial são 8 GPUs como H20-3e, usando vLLM ou SGLang com MTP habilitado.

Benchmarks: força em código, STEM e agentes

Os números publicados pela equipe de pesquisa mostram um modelo competitivo em múltiplas frentes:

ÁreaBenchmarkHy3
CódigoSWE-Bench Verified78.0
CódigoSWE-Bench Pro57.9
CódigoSWE-Bench Multilingual75.8
CódigoTerminal-Bench 2.171.7
STEMGPQA Diamond90.4
MatemáticaUSAMO 202672.0
MatemáticaIMOAnswerBench90.0
RaciocínioHLE (com ferramentas)53.2
Benchmarks oficiais do Hy3 divulgados pela Tencent.

Em um teste cego com 270 especialistas e 312 comparações em fluxos reais de trabalho, o Hy3 marcou 2.67 de 4 pontos, à frente do GLM-5.1 (2.51). A vantagem foi mais clara em desenvolvimento frontend, CI/CD e dados e armazenamento.

Confiabilidade em produção: menos alucinações, melhor tracking

A equipe da Tencent focou em três modos de falha que costumam quebrar agentes em produção:

  • Tool calling estável: correções de baseline reduziram loops infinitos causados por chamadas inválidas. A variância de acurácia entre scaffolds (CodeBuddy, Cline, KiloCode) ficou dentro de 4% no SWE-Bench Verified.
  • Anti-alucinação: a taxa de alucinação caiu de 12.5% para 5.4% em avaliações internas. Erros de conhecimento de senso comum caíram de 25.4% para 12.7%.
  • Rastreamento de intenção multi-turno: SFT e RL conjuntos reduziram a taxa de erro interno de 17.4% para 7.9%. No benchmark MRCR de diálogos longos, a pontuação subiu de 42.9% para 75.1%.

API compatível com OpenAI e acesso gratuito

O Hy3 expõe uma API compatível com OpenAI — basta apontar o cliente para o endpoint local. Um parâmetro reasoning_effort controla o nível de raciocínio: "no_think" para respostas diretas, "low" para tarefas moderadas e "high" para matemática, código ou tarefas multi-etapa.

Para quem não quer rodar localmente, o OpenRouter oferece uma rota gratuita (tencent/hy3:free) a $0 por token, disponível até 21 de julho de 2026.

Casos de uso práticos

  • Agentes de código: alimente um repositório inteiro na janela de 256K e peça para corrigir testes com reasoning_effort="high".
  • Processamento de documentos: contratos longos ou filings como contexto, com o treinamento anti-alucinação reduzindo cláusulas fabricadas.
  • Análise financeira: combine tabelas e prosa em um prompt e peça um resumo fundamentado que sinalize dados ausentes.
  • Desenvolvimento frontend: gere componentes React ou game loops — o teste cego mostrou vantagem sobre GLM-5.1 nesta área.

O que o Hy3 não é

É importante contextualizar: nos benchmarks de código, o GLM-5.2 (~744B MoE, ~40B ativos) lidera. O Hy3 troca alguma acurácia em código por um footprint ativo muito menor — 21B contra ~40B. Para quem faz self-host e paga por GPU, essa diferença de tamanho é relevante. Além disso, os 295B totais exigem infraestrutura significativa: 8 GPUs de datacenter não são triviais para times pequenos.

Disponibilidade

  • Pesos: Hugging Face — tencent/Hy3
  • Código: repositório no GitHub da Tencent
  • API gratuita: OpenRouter (tencent/hy3:free) até 21/07/2026
  • Ferramentas: AngelSlim para quantização e fine-tuning

Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.