Inteligência artificial, sem ruído.
Modelos e LLMs5 min

Meituan Lança LongCat-2.0: Modelo Aberto de 1,6 Trilhões de Parâmetros com Atenção Esparsa e Contexto de 1M Tokens

Meituan lança LongCat-2.0, modelo MoE de 1,6 trilhão de parâmetros com janela de 1 milhão de tokens e atenção esparsa, treinado inteiramente em hardware chinês. Código aberto sob licença MIT.

Meituan Lança LongCat-2.0: Modelo Aberto de 1,6 Trilhões de Parâmetros com Atenção Esparsa e Contexto de 1M Tokens

A Meituan, gigante chinesa de tecnologia e entregas, acaba de lançar o LongCat-2.0, um modelo de linguagem com arquitetura Mixture-of-Experts (MoE) de 1,6 trilhão de parâmetros totais, ativando aproximadamente 48 bilhões por token. O modelo é voltado especificamente para codificação agentiva: compreensão, geração e execução de código dentro de fluxos de agentes autônomos.

O que torna o LongCat-2.0 diferente

Dois fatos chamam atenção imediata. Primeiro, o modelo suporta uma janela de contexto nativa de 1 milhão de tokens — suficiente para processar bases de código inteiras de uma só vez. Segundo, tanto o treinamento quanto a inferência rodaram inteiramente em superpods de ASICs domésticos chineses, sem nenhum hardware da Nvidia.

O LongCat-2.0 sucede o LongCat-Flash (560B, lançado em 2025) e foi pré-treinado com mais de 35 trilhões de tokens ao longo de milhões de horas de acelerador. A Meituan relata zero rollbacks ou picos de perda irrecuperáveis durante a execução — um feito notável em hardware não-Nvidia, onde o ferramental de treinamento é menos maduro.

Arquitetura: quatro ideias que reduzem o custo da escala

O design do LongCat-2.0 combina quatro inovações que merecem atenção individual:

1. Zero-computation experts

Nem todo token precisa de computação pesada. Tokens simples (como pontuação) são roteados para um expert de custo zero e retornam inalterados. Tokens complexos recebem mais capacidade. Um controlador PID ajusta o viés dos experts para manter a média de ativação em uma faixa controlada, produzindo uma janela dinâmica de 33B a 56B parâmetros ativos por token. O backbone MoE usa um design com atalhos (ScMoE) para maior throughput.

2. LongCat Sparse Attention (LSA)

A atenção padrão escala quadraticamente com o comprimento do contexto. O LSA seleciona apenas os tokens mais relevantes, reduzindo o custo de contexto longo para aproximadamente linear. A Meituan o descreve como uma evolução do DeepSeek Sparse Attention (DSA), com três métodos de indexação ortogonais: Streaming-aware Indexing (transforma leituras fragmentadas em blocos contíguos), Cross-Layer Indexing (reutiliza saliência de atenção entre camadas adjacentes) e Hierarchical Indexing (indexação em duas etapas, coarse-to-fine).

3. N-gram Embedding

Um módulo de embedding de N-gramas com 135 bilhões de parâmetros adicionais opera em dimensões esparsas ortogonais aos experts MoE. Ele captura relações densas entre tokens locais e reduz I/O de memória durante decodificação em grandes lotes.

4. Post-training MOPD

Um pipeline dedicado (MOPD) funde três grupos de experts professores — cobrindo capacidades de Agente, Raciocínio e Interação — em um modelo unificado.

Para serving, a Meituan utiliza paralelismo 6D com arquitetura desagregada de prefill-decode, além de “super kernels” e prefetching de pesos em cache L2 para ocultar latência de I/O.

Benchmarks e posicionamento

Resultados reportados pela Meituan. Confirmação independente ainda não disponível.

Em benchmarks de agentes gerais como FORTE e BrowseComp, o modelo fica atrás dos sistemas de fronteira. A vantagem está concentrada em engenharia de software.

Casos de uso na prática

  • Raciocínio sobre repositórios inteiros: alimente uma base de código completa na janela de 1M tokens e peça para rastrear um bug entre múltiplos arquivos.
  • Tarefas de terminal multi-etapas: execute o modelo em um loop de agente com acesso ao shell para comandos, leitura de erros e novas tentativas.
  • Refatoração em larga escala: mudanças coordenadas em múltiplos módulos e testes com visão completa do projeto.
  • Migração entre linguagens: use a força multilíngue do SWE-bench Multilingual para portar lógica entre linguagens preservando comportamento.

Como acessar

O LongCat-2.0 está disponível via LongCat API Platform com endpoints compatíveis com OpenAI e Anthropic. Também está no OpenRouter e em harnesses como Claude Code, OpenClaw, OpenCode e Codex. A hospedagem local ainda não é possível — os pesos permanecem pendentes de liberação.

O modelo é liberado sob licença MIT. Preços reportados: US$ 0,75 por milhão de tokens de entrada e US$ 2,95 por milhão de saída. Uma promoção de lançamento lista US$ 0,30 e US$ 1,20, com leituras de contexto em cache gratuitas. Os valores vêm de cobertura de terceiros e podem mudar.

O que isso significa

O LongCat-2.0 é significativo por três razões. Primeiro, demonstra que é possível treinar um modelo de 1,6T de parâmetros com desempenho competitivo usando exclusivamente hardware chinês — um marco geopolítico relevante no contexto das sanções de exportação de chips. Segundo, a combinação de janela de 1M tokens com atenção esparsa resolve um gargalo prático importante para agentes de código que precisam operar em bases completas. Terceiro, a licença MIT e a compatibilidade com APIs OpenAI/Anthropic reduzem a fricção de adoção.

Por outro lado, a ausência de confirmação independente dos benchmarks e a impossibilidade de self-hosting (pesos ainda não liberados) são limitações importantes. O modelo também não compete em benchmarks de agentes gerais — é uma ferramenta especializada, não generalista.



Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.

BenchmarkLongCat-2.0Comparação
SWE-bench Pro59,5Supera GPT-5.5 (58,6)
Terminal-Bench 2.170,8Foco em tarefas de terminal multi-etapas
SWE-bench Multilingual77,3Força em repositórios multilíngues