O que mudou
A Cartesia lançou o Sonic-3.6, a nova versão do seu modelo de texto para fala (TTS) em tempo real, cerca de três meses depois do Sonic-3.5. A diferença desta vez não é só marketing: a qualidade agora pode ser verificada de forma independente. O modelo ocupa o primeiro lugar nos dois rankings de voz da Artificial Analysis — 1.283 pontos Elo no quadro “Provider Voice” e 1.123 no “Controlled Voice”.
O segundo resultado é o mais importante. No quadro “Controlled”, todos os modelos são clonados sobre as mesmas oito vozes de referência, o que isola o motor de síntese do catálogo de vozes. Liderar esse ranking significa que o motor melhorou de verdade, e não apenas a seleção de vozes. O Sonic-3.5 fica em segundo e o ElevenLabs Eleven v3 em terceiro.
Arquitetura e latência
O Sonic roda sobre modelos de espaço de estados (state space models) em vez de transformers — uma escolha que a Cartesia apresenta como forma de escapar do trade-off clássico entre velocidade e naturalidade. Na prática, a empresa declara menos de 90 ms de tempo até o primeiro áudio e 100 ms de latência de transcrição no modelo de fala para texto Ink-2. Vale registrar: são latências declaradas pelo fornecedor, não medidas ponta a ponta em uma integração real.
Recursos pensados para produção
O Sonic-3.6 expõe controles voltados para transcrições de agentes, e não para narração de conteúdo:
- Tags de expressão inline — sons não verbais como [laughter] vão direto no transcript.
- Clonagem instantânea de voz a partir de cerca de 10 segundos de áudio.
- Dicionários de pronúncia personalizados, incluindo sobrescritas em IPA.
- Parâmetros de velocidade, volume e emoção expostos via API e integrações como o plugin LiveKit Agents.
- Alfanuméricos nativos — números de pedido, telefone e códigos de confirmação lidos corretamente sem pré-processamento.
Preço e disponibilidade
A Artificial Analysis normaliza o Sonic-3.6 em US$ 49 por milhão de caracteres, metade do ElevenLabs Eleven v3 (US$ 100) e bem acima do Speechify Simba 3.2 (US$ 10 para 1.240 Elo). A Cartesia vende créditos, não caracteres: o plano Scale, de US$ 299/mês, inclui cerca de 10.667 minutos de TTS e 15 requisições simultâneas; agentes de voz por linha são cobrados à parte, a US$ 0,06 por minuto.
É importante deixar claro o que o Sonic-3.6 não é: trata-se de um modelo fechado e comercial. Não há pesos abertos nem repositório no Hugging Face — você aluga o serviço. Ele está em beta apenas na API da Cartesia; a documentação ainda lista o Sonic-3.5 como estável, e os parceiros seguem carregando o 3.5.
Por que isso importa agora
O avanço dos agentes de voz — atendimento de entrada, chamadas de qualificação, substituição de URA e localização de mídia — depende de modelos que soem naturais sem custar uma fortuna. Com o Sonic-3.6 liderando um benchmark independente a metade do preço do principal concorrente, a competição no segmento de voz para agentes esquenta. Para o mercado brasileiro, onde o atendimento por voz ainda é dominante em setores como financeiro, saúde e logística, a queda de custo por minuto tem impacto direto na viabilidade econômica dessas aplicações.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



