Por que isso importa
Agentes de voz costumam falhar justamente na parte mais crítica de uma ligação: o número do pedido, os dígitos de retorno de chamada, o endereço de e-mail que o usuário precisa anotar. A Gradium AI anunciou um novo modelo de conversão de texto em fala (TTS) e o tornou padrão em toda a sua API e no Studio, mirando exatamente esses pontos de falha.
Números divulgados pela empresa
Segundo a companhia, o novo modelo registrou uma taxa de aprovação avaliada por humanos de 81,0% em um conjunto difícil de 500 frases distribuídas em cinco idiomas. O resultado fica à frente do Cartesia Sonic 3.6, com 75,1%, e do ElevenLabs v3 Conversational, com 65,4%. O tempo até o primeiro áudio é de 216 ms na mediana (P50) medida na plataforma Coval — 170 ms mais rápido que o modelo que ele substitui.
Implantação sem migração
O modelo já está ativo como padrão desde 31 de agosto de 2026, sem exigir migração por parte dos desenvolvedores. Vozes existentes, incluindo clones personalizados, continuam funcionando sem alterações. Para quem opera assistentes de voz, atendimento automatizado e aplicações de acessibilidade, isso significa uma melhoria de latência e precisão sem mudanças no código.
O que observar
Os números são reportados pela própria Gradium AI e ainda não passaram por validação independente. A comparação com concorrentes usa configurações específicas de cada fornecedor, e o desempenho real tende a variar conforme o idioma, o domínio e as condições de rede. Ainda assim, a combinação de maior precisão em casos difíceis com latência reduzida é um sinal relevante para o mercado de voz, em que a fidelidade na transmissão de dados concretos é o que separa um agente útil de um frustrante.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



