Inteligência artificial, sem ruído.
Open Source7 min

Aleph Alpha libera Kolibri, modelo aberto bilíngue de 78,1 bilhões de parâmetros

Kolibri combina pesos abertos, foco em alemão e arquitetura MoE; entenda limites, infraestrutura e impacto para IA soberana.

Aleph Alpha libera Kolibri, modelo aberto bilíngue de 78,1 bilhões de parâmetros

Kolibri-1 é um modelo de linguagem de pesos abertos da alemã Aleph Alpha que combina 78,1 bilhões de parâmetros totais com apenas 3,46 bilhões ativos por token. O projeto, disponibilizado sob licença Apache 2.0 e treinado para alemão e inglês, entra na disputa por modelos que podem ser implantados em ambientes regulados sem transferir dados ou depender de uma API proprietária. A proposta é relevante porque une uma arquitetura Mixture-of-Experts (MoE), contexto de até 1.048.576 tokens e uma cadeia de desenvolvimento controlada pela própria empresa na Europa.

O que a Aleph Alpha lançou

A Aleph Alpha descreve Kolibri como um transformer MoE bilíngue, desenvolvido com foco em implantação soberana e especializada, especialmente em administração pública, indústria e aeroespacial. Os pesos estão publicados no Hugging Face, enquanto o relatório técnico detalha arquitetura, treinamento e avaliações. “Pesos abertos” não é o mesmo que um serviço pronto e gratuito: a licença Apache 2.0 permite uso amplo, mas a execução de um checkpoint FP8 deste porte exige infraestrutura de GPU significativa.

O número central da arquitetura merece contexto. Em um modelo denso, todos os parâmetros relevantes participam do cálculo de cada token. Em um MoE, um roteador escolhe poucos especialistas para cada token. Kolibri tem 384 especialistas roteados, seleciona os seis mais adequados e também executa um especialista compartilhado. Por isso, seus 78,1 bilhões de parâmetros armazenados não equivalem a 78,1 bilhões de parâmetros computados a cada passo: a Aleph Alpha informa 3,46 bilhões ativos por token, ou 4,4% do total.

Como a arquitetura tenta reduzir o custo de contexto longo

O modelo usa 50 blocos transformer, atenção grouped-query com 48 cabeças de consulta e quatro cabeças de chave/valor. A maior parte dos blocos usa uma janela deslizante de 512 tokens; a cada cinco blocos, há atenção completa. Essa combinação é importante para contexto longo: somente os blocos de atenção completa fazem o cache crescer com todo o histórico, enquanto os demais mantêm uma janela fixa. A Aleph Alpha afirma que, sob computação equivalente, o desenho híbrido suporta sequências quatro vezes maiores que uma arquitetura de atenção completa.

O limite máximo declarado é de 1.048.576 tokens, mas isso não significa que qualquer instalação poderá usar um milhão de tokens. Contexto longo consome memória de cache, reduz a concorrência possível e depende da configuração do servidor. A própria documentação citada pela fonte secundária aponta 262.144 tokens como configuração padrão; ampliar o limite é uma decisão operacional, não uma garantia de custo baixo.

Dados, idiomas e treinamento

Segundo o relatório técnico, Kolibri foi treinado em 24 trilhões de tokens ao longo das fases de pré-treinamento, treinamento intermediário e extensão de contexto. Mais de 20% da mistura é alemão, incluindo mais de dois trilhões de tokens que a empresa diz ter curado da web ou gerado sinteticamente. O objetivo é reduzir uma lacuna comum em modelos generalistas: bom desempenho em inglês não assegura segmentação, vocabulário técnico e comportamento comparáveis em alemão.

A Aleph Alpha também criou o tokenizador UniBPE. No relatório, a empresa compara sua eficiência em alemão com a do tokenizador do GPT-5; são medições internas e não uma prova independente de superioridade geral. Ainda assim, a escolha é tecnicamente coerente: idiomas com composição de palavras e morfologia diferente do inglês podem exigir mais tokens e elevar custo e latência quando o vocabulário foi otimizado sobretudo para texto em inglês.

O que os benchmarks mostram — e o que não mostram

O relatório apresenta resultados em tarefas de conhecimento, matemática, código, instruções e agentes. A empresa informa liderança de Kolibri entre os modelos MoE que incluiu na comparação em médias de inglês e alemão, mas os testes foram conduzidos com seu próprio framework de avaliação. Há números competitivos em GPQA Diamond e AIME, além de desempenho inferior ao Qwen em BFCL v4, benchmark de chamadas de função. Essas diferenças são mais úteis do que uma classificação absoluta: para aplicações corporativas, chamadas de ferramentas, confiabilidade de formato e avaliação com dados internos podem importar mais que um único placar de raciocínio.

Também não há no relatório uma comparação independente que reproduza todas as medições com a mesma infraestrutura e os mesmos prompts. Empresas que considerarem o modelo devem validar português, documentos próprios, políticas de segurança, latência e custo por tarefa antes de substituir uma oferta existente.

Implantação e barreiras práticas

A Aleph Alpha informa que o checkpoint FP8 ocupa cerca de 78 GB e pode ser servido em uma NVIDIA B200, B300 ou H200, ou em duas H100 SXM5, usando vLLM e componentes de inferência da própria empresa. Isso deixa claro o público inicial: equipes com acesso a GPUs de datacenter ou provedores especializados, não um notebook comum. O fato de apenas 3,46 bilhões de parâmetros estarem ativos reduz computação por token, mas não elimina a necessidade de armazenar os pesos nem o custo do cache de contexto.

Para organizações brasileiras, o ponto mais concreto é a possibilidade de manter o fluxo em infraestrutura sob seu controle e adaptar a camada de aplicação a requisitos locais de proteção de dados. Isso não transforma automaticamente o modelo em uma solução compatível com a LGPD. Conformidade depende de base legal, governança, retenção, controles de acesso, contratos e da natureza dos dados enviados ao sistema.

Por que o lançamento importa para modelos abertos europeus

O mercado de modelos abertos costuma ser medido por famílias globais como Qwen, Llama, Mistral e modelos da NVIDIA. Kolibri acrescenta uma proposta explicitamente europeia e bilíngue, com ênfase em controle da cadeia de treinamento e em setores regulados. A Apache 2.0 também reduz incerteza de licenciamento para quem pretende estudar, adaptar ou integrar os pesos, embora não substitua análise jurídica para cada produto final.

Há um contraponto: soberania técnica é uma propriedade de todo o sistema, não apenas do modelo. A empresa que hospeda Kolibri ainda precisa escolher provedor de nuvem ou hardware, proteger logs e prompts, avaliar dependências de software e definir processos para atualizações. Pesos abertos ampliam opções, mas não resolvem sozinhos risco operacional ou dependência de aceleradores.

Análise do NoticIA

Kolibri é mais interessante como sinal de maturidade do ecossistema europeu de modelos abertos do que como uma escolha universal pronta para produção. O desenho MoE e o investimento em alemão respondem a uma demanda real de organizações que precisam de desempenho local e controle de implantação. Ao mesmo tempo, as alegações de eficiência e de liderança vêm do relatório da desenvolvedora; a decisão responsável é comparar o modelo com alternativas em um conjunto de tarefas representativo, medindo custo total, qualidade no idioma relevante e robustez de tool calling.

Para o Brasil, a oportunidade não está em importar uma narrativa de “modelo soberano”, mas em aplicar a lição de arquitetura e governança: modelos de pesos abertos podem ser parte de uma estratégia de autonomia, desde que a infraestrutura, os dados e a avaliação também sejam controlados. Kolibri amplia o cardápio técnico para essa estratégia; não elimina o trabalho de validá-la.

Pontos principais

  • Kolibri-1 tem 78,1 bilhões de parâmetros totais e 3,46 bilhões ativos por token, segundo a Aleph Alpha.
  • O modelo é bilíngue em inglês e alemão, tem pesos abertos sob Apache 2.0 e contexto declarado de até um milhão de tokens.
  • Seu uso prático requer GPUs de datacenter; pesos abertos não significam operação barata em hardware comum.
  • Os benchmarks divulgados são da própria desenvolvedora e devem ser reproduzidos em cenários reais antes de uma adoção corporativa.
  • O lançamento reforça a opção de modelos abertos voltados a implantação controlada, mas conformidade e soberania dependem do sistema inteiro.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.