Inteligência artificial, sem ruído.
Ferramentas e Apps4 min

Gradium lança Voice Design: crie uma voz sintética por descrição de texto em segundos

Ferramenta da francesa Gradium transforma uma descrição de até 500 caracteres em até 5 vozes novas em 3 a 5 segundos — sem áudio de referência nem direitos a liberar.

Gradium lança Voice Design: crie uma voz sintética por descrição de texto em segundos

O problema que a Voice Design resolve

Equipes que constroem agentes de voz esbarram sempre no mesmo muro. O catálogo tem 400 vozes, mas o briefing pede justamente a que não está lá: uma recepcionista quebequense para uma concessionária de Montreal, um narrador de sessenta anos com autoridade de sala de aula. Os briefings superam qualquer catálogo, e a clonagem fecha a lacuna uma voz por vez — cada uma carregando captação, consentimento e licenciamento.

A Gradium, empresa francesa de IA de voz criada a partir do laboratório de pesquisa Kyutai, lançou uma resposta diferente: o Voice Design. A ferramenta lê uma descrição em texto e devolve vozes completas e inéditas em poucos segundos — sem áudio de referência, sem locutor, sem direitos a liberar. O recurso já está disponível na API e no Studio da Gradium, gratuito em todos os planos, inclusive no tier free, e uma voz mantida roda no mesmo endpoint de texto-para-fala (TTS) em streaming que qualquer voz de catálogo, com a mesma latência e os mesmos formatos de saída.

Como funciona

A descrição é o único insumo do modelo. A documentação da Gradium lista os atributos que a ferramenta interpreta, e eles se leem como uma ficha de elenco: gênero, faixa etária, sotaque ou origem, tom, ritmo, energia, timbre, ressonância, registro e a função que a voz vai desempenhar.

As descrições têm de 1 a 500 caracteres e funcionam em inglês, francês, espanhol, português e alemão. A Gradium recomenda encerrar a descrição com o uso pretendido, porque isso orienta a entrega e o registro da voz, e não apenas a “cor” dela. Uma requisição retorna de 1 a 5 candidatas, normalmente prontas em 3 a 5 segundos. São variações de um mesmo personagem — um personagem diferente exige uma descrição diferente, não mais amostras.

Do candidato à voz de produção

O fluxo tem quatro chamadas de API. POST /voice-generator/generate cria os IDs candidatos com ready: false. GET /voice-generator/embeddings faz polling até virarem ready: true. Cada candidata faz teste pelo endpoint de TTS comum, usando o ID como voice_id. POST /voices/from-embedding promove a escolhida.

As candidatas têm três restrições que as vozes convertidas não têm: o texto de teste é limitado a 100 caracteres, funcionam apenas via REST, e os endpoints WebSocket de TTS e o Speech-to-Speech as rejeitam. Candidatas não convertidas são apagadas após 30 dias. Converter é gratuito, elimina o prazo de expiração e consome uma vaga de voz customizada compartilhada com clones — o plano gratuito tem 5 vagas, os pagos têm 1.000.

A amostragem é deliberadamente não determinística: a equipe expande a descrição antes de gerar, e essa expansão varia a cada requisição. Por isso, o mesmo prompt com a mesma semente ainda produz uma voz diferente.

O benchmark — e como lê-lo

A Gradium rodou um teste cego de escuta pareada em prompts de sotaque, comparando seis sistemas de voice design acessíveis por APIs públicas em cinco idiomas. Falantes nativos ouviam dois clipes sem rótulo e escolhiam o que mais se aproximava do pedido (ou empatavam). Em 7.627 comparações, a Gradium reporta uma taxa de vitória de 72,6% contra o campo — 13,6 pontos à frente do eleven_ttv_v3 da ElevenLabs, com 59,0%, seguido por Inworld (44,8%), Fish Audio (36,7%) e MiniMax (31,7%).

A taxa de vitória conta vitórias mais metade dos empates, então 50% é o par. A Gradium ficou em primeiro nos cinco idiomas, com as maiores margens justamente nos sotaques regionais que a maioria dos catálogos achata: francês quebequense com 97%, espanhol rioplatense com 86%, alemão bávaro com 85%, espanhol colombiano e português africano com 83%.

Um juiz de modelo (Gemini 3.1 Pro) chegou à mesma ordem ao avaliar clipes únicos de 1 a 5: Gradium 4,06, ElevenLabs 3,86, Inworld 3,64, Fish Audio 3,51. A página do produto ainda cita 83,4% de aderência ao prompt na divisão em inglês do InstructTTSEval, o benchmark acadêmico de instrução em TTS.

Ressalva importante: todos esses números foram desenhados e executados pelo próprio fornecedor. Vale tratá-los como evidência de direção, não como veredito independente.

Por que isso importa agora

Para o mercado brasileiro, dois pontos chamam atenção. O primeiro é o suporte nativo ao português na descrição — incluindo o português africano, em que a Gradium reporta 83% de acerto em sotaque regional. O segundo é a remoção do atrito legal e logístico da clonagem: sem áudio de referência, não há locutor para captar, consentimento para coletar nem direitos para liberar. Isso reduz o custo de colocar em produção agentes de voz com identidade própria — atendimento, dublagem, audiolivros e acessibilidade.

Ainda assim, o Voice Design não substitui a clonagem quando a meta é reproduzir uma voz específica e conhecida. Ele resolve o caso oposto: quando a voz ainda não existe e precisa ser inventada, parametrizada e escalada rapidamente.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.