A Meituan, gigante chinesa de tecnologia e entregas, acaba de lançar o LongCat-2.0, um modelo de linguagem com arquitetura Mixture-of-Experts (MoE) de 1,6 trilhão de parâmetros totais, ativando aproximadamente 48 bilhões por token. O modelo é voltado especificamente para codificação agentiva: compreensão, geração e execução de código dentro de fluxos de agentes autônomos.
O que torna o LongCat-2.0 diferente
Dois fatos chamam atenção imediata. Primeiro, o modelo suporta uma janela de contexto nativa de 1 milhão de tokens — suficiente para processar bases de código inteiras de uma só vez. Segundo, tanto o treinamento quanto a inferência rodaram inteiramente em superpods de ASICs domésticos chineses, sem nenhum hardware da Nvidia.
O LongCat-2.0 sucede o LongCat-Flash (560B, lançado em 2025) e foi pré-treinado com mais de 35 trilhões de tokens ao longo de milhões de horas de acelerador. A Meituan relata zero rollbacks ou picos de perda irrecuperáveis durante a execução — um feito notável em hardware não-Nvidia, onde o ferramental de treinamento é menos maduro.
Arquitetura: quatro ideias que reduzem o custo da escala
O design do LongCat-2.0 combina quatro inovações que merecem atenção individual:
1. Zero-computation experts
Nem todo token precisa de computação pesada. Tokens simples (como pontuação) são roteados para um expert de custo zero e retornam inalterados. Tokens complexos recebem mais capacidade. Um controlador PID ajusta o viés dos experts para manter a média de ativação em uma faixa controlada, produzindo uma janela dinâmica de 33B a 56B parâmetros ativos por token. O backbone MoE usa um design com atalhos (ScMoE) para maior throughput.
2. LongCat Sparse Attention (LSA)
A atenção padrão escala quadraticamente com o comprimento do contexto. O LSA seleciona apenas os tokens mais relevantes, reduzindo o custo de contexto longo para aproximadamente linear. A Meituan o descreve como uma evolução do DeepSeek Sparse Attention (DSA), com três métodos de indexação ortogonais: Streaming-aware Indexing (transforma leituras fragmentadas em blocos contíguos), Cross-Layer Indexing (reutiliza saliência de atenção entre camadas adjacentes) e Hierarchical Indexing (indexação em duas etapas, coarse-to-fine).
3. N-gram Embedding
Um módulo de embedding de N-gramas com 135 bilhões de parâmetros adicionais opera em dimensões esparsas ortogonais aos experts MoE. Ele captura relações densas entre tokens locais e reduz I/O de memória durante decodificação em grandes lotes.
4. Post-training MOPD
Um pipeline dedicado (MOPD) funde três grupos de experts professores — cobrindo capacidades de Agente, Raciocínio e Interação — em um modelo unificado.
Para serving, a Meituan utiliza paralelismo 6D com arquitetura desagregada de prefill-decode, além de “super kernels” e prefetching de pesos em cache L2 para ocultar latência de I/O.
Benchmarks e posicionamento
| Benchmark | LongCat-2.0 | Comparação |
|---|---|---|
| SWE-bench Pro | 59,5 | Supera GPT-5.5 (58,6) |
| Terminal-Bench 2.1 | 70,8 | Foco em tarefas de terminal multi-etapas |
| SWE-bench Multilingual | 77,3 | Força em repositórios multilíngues |



