O Hugging Face lançou em 30 de setembro de 2026 o Open TTS Leaderboard, uma tabela de avaliação para modelos abertos de texto para fala e clonagem de voz. A iniciativa mede inteligibilidade, velocidade e similaridade de locutor em vez de depender apenas de votos humanos. O objetivo é reduzir de semanas para horas o tempo necessário para incluir um modelo em uma comparação pública, sem apresentar métricas automáticas como substitutas da preferência de quem escuta.
Por que um ranking específico para TTS aberto
O número de modelos de texto para fala no Hub do Hugging Face ultrapassou 8 mil, segundo o anúncio. A abundância não significa comparabilidade: modelos diferem em idioma, arquitetura, necessidade de GPU, latência, qualidade de clonagem e licença. Rankings baseados em arenas humanas ajudam a avaliar naturalidade, mas exigem hospedar cada modelo, coletar votos suficientes e manter consistência entre avaliadores. Isso tende a favorecer APIs comerciais, que são mais simples de conectar, e deixa projetos de pesos abertos sub-representados.
O Hugging Face aponta que somente 16 dos 92 modelos listados no ranking de voz da Artificial Analysis eram de pesos abertos na data do anúncio. O novo leaderboard tenta preencher essa lacuna com uma bateria reproduzível. Ele não decide qual voz é mais agradável; fornece medições objetivas que ajudam desenvolvedores a eliminar escolhas inadequadas antes de fazer escuta e testes no produto real.
As três dimensões medidas
| Métrica | Como é calculada | O que ajuda a responder |
|---|---|---|
| Inteligibilidade | WER e CER entre o texto solicitado e a transcrição do áudio gerado, usando Qwen3 ASR | A fala reproduz corretamente o conteúdo? |
| Velocidade em lote | RTFx inverso em GPU NVIDIA H200 | Quanto áudio o modelo produz por unidade de tempo em inferência offline? |
| Latência de streaming | TTFA, ou tempo até o primeiro áudio, em H200 e para alguns modelos em CPU | Quanto o usuário espera em uma conversa por voz? |
| Similaridade de locutor | Similaridade de cosseno de embeddings WavLM entre voz gerada e referência | O clone preserva a identidade vocal? |
Para inteligibilidade, o ranking usa Word Error Rate (WER) e Character Error Rate (CER). WER compara palavras; CER é mais adequado a sistemas de escrita baseados em caracteres, como chinês, japonês e coreano. Os testes usam os conjuntos Seed TTS Eval e CV3 Eval. A transcrição do áudio é produzida pelo Qwen3 ASR, e a comparação mede o desvio em relação ao prompt original.
Essa escolha torna a métrica útil, mas também impõe uma limitação: um sistema de reconhecimento automático pode errar de formas correlacionadas com certos sotaques ou línguas. Baixo WER indica boa inteligibilidade no conjunto avaliado, não prova que a voz parece humana, expressiva ou adequada a um locutor brasileiro.
Multilíngue e clonagem de voz
A visualização padrão ordena os modelos pela média de WER em inglês. O usuário pode mudar o filtro de idioma e habilitar a comparação de clonagem de voz. Nessa modalidade, o ranking acrescenta similaridade de locutor e gráficos de Pareto, que deixam visível o compromisso entre fidelidade, velocidade e tamanho do modelo.
O anúncio destaca Kokoro-82M, Supertonic-3 e s2-pro entre os melhores em WER em inglês na média dos dois conjuntos. Para desempenho multilíngue, cita OmniVoice, s2-pro e Fun-CosyVoice3-0.5B-2512 como opções fortes. Esses nomes não devem ser tratados como recomendação universal: o próprio leaderboard separa idioma, modo de clonagem e hardware porque uma liderança em inglês, por exemplo, não garante desempenho equivalente em português brasileiro.
Streaming é mais do que velocidade total
Para agentes de voz, a percepção de agilidade depende do primeiro fragmento reproduzível, não apenas do tempo final para gerar toda a frase. Por isso o ranking usa Time to First Audio (TTFA) com prompts padronizados e descarta as três primeiras execuções como aquecimento. Em modelos com API de streaming, mede a chegada do primeiro chunk; em modelos sem streaming, mede o momento em que todo o enunciado fica disponível.
O benchmark reporta a mediana das execuções restantes e oferece uma aba de CPU para um conjunto ainda pequeno de modelos. Essa distinção é relevante para equipes que avaliam atendimento automatizado, leitura de conteúdo e recursos de acessibilidade: um modelo pode produzir mais áudio por segundo em lote e ainda oferecer uma primeira resposta lenta em conversa ao vivo.
O que o ranking não mede
O Hugging Face reconhece explicitamente que métricas automáticas não substituem preferência humana. WER não mede ritmo, emoção, naturalidade nem adequação cultural; similaridade de embeddings não resolve consentimento nem o risco de confundir um clone com uma pessoa real. Há também limites de benchmark: os resultados foram obtidos em hardware, conjuntos e configurações definidos pelo projeto. Em produção, quantização, servidor, fila, rede e vocabulário do domínio alteram a experiência.
Para empresas, uma avaliação responsável de clonagem de voz deve acrescentar autorização documentada do locutor, aviso claro ao público quando a voz for sintética, controles contra uso indevido e teste com frases, sotaques e termos do próprio serviço. O ranking ajuda na seleção técnica; não substitui essas decisões de produto e governança.
Como usar o Open TTS Leaderboard na prática
- Defina o caso de uso: narração offline, assistente em tempo real, acessibilidade ou clonagem exigem pesos diferentes entre WER, TTFA e similaridade.
- Filtre por idioma e hardware: priorize resultados compatíveis com português e com a infraestrutura disponível, não apenas a posição geral.
- Ouça amostras: a aba “Listen” permite comparar as saídas associadas aos números.
- Faça um piloto próprio: avalie vocabulário, taxa de erro, tempo de resposta e licença no seu fluxo antes de trocar um provedor.
Análise do NoticIA
O ganho do Open TTS Leaderboard é transformar uma escolha antes guiada por demos em uma triagem técnica auditável. A decisão de manter escuta humana como complemento é acertada: em voz, a métrica mais fácil de automatizar raramente é a mais importante para o ouvinte. Para o mercado brasileiro, falta observar se a cobertura de português, sotaques regionais e vozes de referência crescerá com a comunidade. Sem isso, uma tabela multilíngue pode continuar sendo, na prática, uma tabela centrada em inglês.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



