O laboratório Tongyi da Alibaba acaba de liberar o Qwen-Audio-3.0-TTS, um sistema de síntese de voz para produção que já estreia no topo do ranking independente Artificial Analysis. O modelo chega em duas versões — Flash (tempo real) e Plus (qualidade máxima) — como serviço hospedado na Alibaba Cloud, sem pesos abertos para download.
Duas variantes para necessidades diferentes
A versão Flash foi ajustada para interação em tempo real, com latência do primeiro pacote na casa dos 300 milissegundos. A Plus prioriza naturalidade, fidelidade de timbre e qualidade perceptual, mesmo que isso custe um pouco mais de latência. Os IDs são qwen-audio-3.0-tts-flash e qwen-audio-3.0-tts-plus.
Ambas operam sobre WebSocket bidirecional com streaming de entrada e saída, suportando PCM, WAV, MP3 e Opus com taxa de amostragem de até 48 kHz. A API oferece clonagem de voz, Voice Design e controle por instrução, com SDKs em Python, Java, Go, C#, PHP e Node.js.
Construção técnica: tokenizador de baixa taxa e treinamento progressivo
Dois pilares sustentam a arquitetura. Um tokenizador de fala de 12,5 Hz reduz o custo da decodificação autorregressiva mantendo conteúdo e informação de locutor — menos tokens por segundo de áudio significa menos latência de inferência. Um treinamento progressivo em cinco estágios coordena o modelo de linguagem (LM) e os componentes de flow-matching (FM), passando por pré-treinamento independente, ajuste conjunto com annealing, aprendizado por reforço do LM, treinamento de robustez do FM e reforço do FM.
O resultado é um sistema capaz de síntese longa (até 3 minutos em uma passagem), casos difíceis de normalização de texto e super-resolução via vocoder para saída de 48 kHz.
16 idiomas, 20 dialetos chineses e português na lista
O modelo cobre 16 idiomas: árabe, chinês, inglês, francês, alemão, indonésio, italiano, japonês, coreano, malaio, português, russo, espanhol, tagalo, tailandês e vietnamita. Sete desses são novos em relação à geração anterior. Também inclui 20 regiões de dialeto chinês.
Na métrica de inteligibilidade multilíngue (WER/CER), o Flash registra a melhor média geral com 3,87; o Plus vem logo atrás com 3,96. Em similaridade de locutor, o Plus lidera em todos os 16 idiomas com média de 82,75.
86 tags inline para controle de detalhes não verbais
O modelo introduz 86 tags inline que podem ser inseridas diretamente no texto de entrada para controlar emoção, estilo e eventos não verbais como risadas, respiração, tosse e suspiros. Exemplo: [excited]Que dia lindo![laughing]Vamos sair e aproveitar!
As tags de controle como [excited], [sad] e [whispers] definem um tom até a próxima tag. As de linguagem rica como [laughing] e [gasp] inserem um efeito vocal pontual.
Liderança no ranking com ressalvas
O Qwen-Audio-3.0-TTS-Plus ocupa o primeiro lugar no Artificial Analysis Speech Arena com Elo de ~1.236, empatado tecnicamente com o Simba 3.2 (1.234). O preço é competitivo: US$ 27,59 por milhão de caracteres, cerca de um terço do que ElevenLabs e MiniMax cobram nos tiers equivalentes.
As limitações são claras: o throughput é modesto (~16 caracteres por segundo, contra 30 do Simba 3.2 e 120 do Sonic 3.5), as tags de emoção funcionam apenas em modo streaming unidirecional, e o modelo é exclusivamente hospedado — não há pesos abertos. Vale notar que a linha Qwen3-TTS (licença Apache 2.0) é um produto separado; o 3.0 é API-only.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



