A Cohere lançou o North Small Translate, um modelo de tradução automática de pesos abertos (open-weight) que representa um marco na volta da empresa — e do próprio Transformer — às origens. O modelo usa uma arquitetura esparsa Mixture-of-Experts (MoE) com 218 bilhões de parâmetros no total e 25 bilhões ativos por token, cobrindo 50 idiomas, do albanês ao vietnamita.
De volta aonde o Transformer começou
Em 2017, os pesquisadores do Google apresentaram o Transformer no artigo Attention Is All You Need, cujos principais resultados vieram justamente da tradução automática (WMT 2014 inglês-alemão e inglês-francês). Nove anos depois, a Cohere retorna a esse problema original com um modelo dedicado. A empresa enquadra a tradução como uma questão de soberania: organizações que não conseguem se comunicar globalmente não conseguem manter sua autonomia.
É o primeiro modelo de tradução da família North, seguindo a linhagem multilíngue da Cohere (Tiny Aya e Command A Translate). A Cohere o construiu em parceria com a RWS, cujos cientistas da Language Weaver ajudaram a moldar a qualidade no mundo real.
Arquitetura e desempenho
O modelo é um Transformer decoder-only com 128 especialistas (8 ativados por token, além de especialistas compartilhados), router por sigmoid sobre logits, camadas de atenção com janela deslizante (janela 4096 com RoPE) intercaladas com camadas globais na proporção 3:1, e contexto de 16K tokens de entrada e 16K de saída. Cerca de 11,5% dos pesos ficam ativos por token.
Nos benchmarks reportados pela própria Cohere, o modelo atinge 83,6 no WMT26 na média de todos os idiomas (84,36 na variante “Agentic”, que roda um fluxo multi-passagem que encontra e corrige os próprios erros). A empresa afirma que isso supera DeepL, Google Translate e opções abertas como GLM 5.2 e Mistral Large 3. Vale a ressalva: são números fornecidos pelo próprio fornecedor, com o GPT-5.6-Sol como juiz — trate-os como preliminares até que resultados independentes do WMT26 apareçam.
Velocidade, documentos longos e custo
Nos testes da Cohere, o modelo gerou 112 tokens por segundo contra 81 do Gemma 4 31B em hardware idêntico (até 1,4x mais throughput). Em documentos longos, o destaque é ainda maior: traduz dois capítulos de livro em uma única chamada com pontuação 48,9, contra 21,3 do Google Translate e 19,4 do Gemma 4 31B.
No quesito custo, a Cohere aponta US$ 0,000676 por tarefa (média de 661 tokens), cerca de 58 vezes menos que o Gemini 3.1 Pro Preview (US$ 0,038928 por tarefa).
Como usar
O caminho mais rápido é a API Chat V2 da Cohere, onde o modelo é gratuito até os limites de taxa. Para self-hosting, a empresa publica três checkpoints (BF16, FP8 e NVFP4 W4A16), os mesmos servidos em produção — o checkpoint de 4 bits roda em 1x B200 ou 2x H100.
Por que isso importa: tradução automática de qualidade próxima à de modelos proprietários, com pesos abertos e custo radicalmente menor, muda o cálculo para empresas que precisam operar em dezenas de idiomas sem depender de APIs fechadas ou pagar por tradução por token em escala.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



