Inteligência artificial, sem ruído.
Modelos e LLMs2 min

Hugging Face e Cerebras levam Gemma 4 para assistentes de voz em tempo real

Parceria entre Hugging Face e Cerebras combina Gemma 4 com inferência ultrarrápida para criar assistentes de voz speech-to-speech totalmente open source e com latência mínima.

Hugging Face e Cerebras levam Gemma 4 para assistentes de voz em tempo real
Imagem de apoio. Fonte: Hugging Face Blog.

A Hugging Face e a Cerebras anunciaram uma parceria que promete transformar a experiência de assistentes de voz com IA. A demonstração combina o modelo Gemma 4 31B do Google DeepMind com a inferência ultrarrápida dos chips Cerebras para criar um pipeline de voz speech-to-speech totalmente open source.

Arquitetura modular e aberta

O sistema funciona como uma pipeline em cascata com quatro estágios substituíveis: reconhecimento de fala com o Parakeet da NVIDIA, raciocínio com o Gemma 4 VLM nos chips Cerebras, síntese de voz com o Qwen3TTS da Alibaba, e resposta falada. Cada componente é modular e aberto — desenvolvedores podem trocar qualquer peça para adaptar o stack a diferentes assistentes, robôs ou projetos de pesquisa.

Latência é o diferencial

O gargalo crítico em assistentes de voz sempre foi a latência. Sistemas atuais podem ter tempos de resposta medianos aceitáveis, mas sofrem com atrasos de múltiplos segundos no percentil 95 — especialmente quando chamadas de ferramentas ou etapas multimodais exigem múltiplos turnos. A Cerebras resolve isso com inferência dramaticamente mais rápida e estável, eliminando aqueles momentos frustrantes em que a conversa parece “travada”.

Aplicações no mundo real

Este mesmo pipeline já equipa os robôs Reachy Mini, com mais de 9.000 unidades operando globalmente. Para robôs, assistentes de voz e IA incorporada, a responsividade não é um luxo cosmético — é o que faz a interação parecer viva e natural.

A colaboração reflete uma aposta compartilhada: o futuro da IA conversacional será aberto e de alto desempenho. Modelos open source, infraestrutura aberta e velocidade de inferência criam juntos a base para a próxima geração de IA de voz.

O código está disponível no repositório huggingface/speech-to-speech e os desenvolvedores são convidados a experimentar o demo e contribuir com o futuro da IA de voz em tempo real.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.