Inteligência artificial, sem ruído.
Modelos e LLMs3 min

Cartesia lança Sonic-3.6, modelo de voz que lidera os dois rankings de fala da Artificial Analysis

Novo modelo TTS da Cartesia lidera os rankings da Artificial Analysis com 1.283 Elo. Latência abaixo de 90 ms e metade do preço do ElevenLabs v3.

Cartesia lança Sonic-3.6, modelo de voz que lidera os dois rankings de fala da Artificial Analysis

O que mudou

A Cartesia lançou o Sonic-3.6, a nova versão do seu modelo de texto para fala (TTS) em tempo real, cerca de três meses depois do Sonic-3.5. A diferença desta vez não é só marketing: a qualidade agora pode ser verificada de forma independente. O modelo ocupa o primeiro lugar nos dois rankings de voz da Artificial Analysis — 1.283 pontos Elo no quadro “Provider Voice” e 1.123 no “Controlled Voice”.

O segundo resultado é o mais importante. No quadro “Controlled”, todos os modelos são clonados sobre as mesmas oito vozes de referência, o que isola o motor de síntese do catálogo de vozes. Liderar esse ranking significa que o motor melhorou de verdade, e não apenas a seleção de vozes. O Sonic-3.5 fica em segundo e o ElevenLabs Eleven v3 em terceiro.

Arquitetura e latência

O Sonic roda sobre modelos de espaço de estados (state space models) em vez de transformers — uma escolha que a Cartesia apresenta como forma de escapar do trade-off clássico entre velocidade e naturalidade. Na prática, a empresa declara menos de 90 ms de tempo até o primeiro áudio e 100 ms de latência de transcrição no modelo de fala para texto Ink-2. Vale registrar: são latências declaradas pelo fornecedor, não medidas ponta a ponta em uma integração real.

Recursos pensados para produção

O Sonic-3.6 expõe controles voltados para transcrições de agentes, e não para narração de conteúdo:

  • Tags de expressão inline — sons não verbais como [laughter] vão direto no transcript.
  • Clonagem instantânea de voz a partir de cerca de 10 segundos de áudio.
  • Dicionários de pronúncia personalizados, incluindo sobrescritas em IPA.
  • Parâmetros de velocidade, volume e emoção expostos via API e integrações como o plugin LiveKit Agents.
  • Alfanuméricos nativos — números de pedido, telefone e códigos de confirmação lidos corretamente sem pré-processamento.

Preço e disponibilidade

A Artificial Analysis normaliza o Sonic-3.6 em US$ 49 por milhão de caracteres, metade do ElevenLabs Eleven v3 (US$ 100) e bem acima do Speechify Simba 3.2 (US$ 10 para 1.240 Elo). A Cartesia vende créditos, não caracteres: o plano Scale, de US$ 299/mês, inclui cerca de 10.667 minutos de TTS e 15 requisições simultâneas; agentes de voz por linha são cobrados à parte, a US$ 0,06 por minuto.

É importante deixar claro o que o Sonic-3.6 não é: trata-se de um modelo fechado e comercial. Não há pesos abertos nem repositório no Hugging Face — você aluga o serviço. Ele está em beta apenas na API da Cartesia; a documentação ainda lista o Sonic-3.5 como estável, e os parceiros seguem carregando o 3.5.

Por que isso importa agora

O avanço dos agentes de voz — atendimento de entrada, chamadas de qualificação, substituição de URA e localização de mídia — depende de modelos que soem naturais sem custar uma fortuna. Com o Sonic-3.6 liderando um benchmark independente a metade do preço do principal concorrente, a competição no segmento de voz para agentes esquenta. Para o mercado brasileiro, onde o atendimento por voz ainda é dominante em setores como financeiro, saúde e logística, a queda de custo por minuto tem impacto direto na viabilidade econômica dessas aplicações.



Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.