Dois modelos, uma virada na síntese de voz
O Google acaba de lançar dois novos modelos de conversão de texto em fala na família Gemini Audio: o Gemini 3.8 Flash TTS e o Gemini 3.8 Flash-Lite TTS. A empresa os descreve como seus modelos de geração de áudio mais expressivos até hoje, com uma mudança estrutural: em vez de escolher entre um número fixo de vozes prontas, o desenvolvedor agora projeta vozes a partir de um prompt de texto, descrevendo papel, sotaque e características vocais.
Duas camadas para públicos diferentes
O lançamento divide a síntese de voz em dois níveis com controles de direção compartilhados:
- Gemini 3.8 Flash TTS — voltado para direção criativa profunda e design de personagens. Os alvos são jogos, audiolivros imersivos, podcasts e mídia interativa. Oferece controle granular sobre atuação, ritmo, mudanças de dialeto e backchanneling (interjeições de escuta ativa).
- Gemini 3.8 Flash-Lite TTS — otimizado para produção em alto volume e custo eficiente. O Google o posiciona para dublagem, criação de conteúdo em áudio e agentes de voz expressivos.
Design de voz a partir de um prompt
Os modelos anteriores de TTS da Gemini ofereciam cerca de 30 vozes originais. A versão 3.8 inaugura um sistema muito maior. O design generativo de voz cria novas vozes a partir de prompts que descrevem papel, sotaque e características — em mais de 100 idiomas e dialetos. As demonstrações do Google incluem um DJ de Melbourne, um robô monótono e um dragão japonês.
Os desenvolvedores também ganham uma biblioteca com mais de 2.000 vozes prontas para produção, incluindo variedades regionais como espanhol mexicano, francês do Quebec e inglês escocês. Vozes personalizadas podem ser salvas e reutilizadas com mínimo desvio entre projetos.
Direção de atuação e replicação de voz
Os dois modelos aceitam direções de palco escritas no próprio roteiro, além de geração longa que mantém qualidade e timbre por horas de áudio contínuo. Há suporte nativo a diálogos com dois falantes separados, rajadas vocais não verbais como <laughs> e <sigh>, e marcadores de escuta ativa como |mhm| e |yeah|.
Para replicação de voz, o sistema constrói um perfil vocal consistente a partir de uma amostra de 30 segundos — que precisa ser da sua própria voz ou de alguém de quem você tenha direitos. A replicação exige uma gravação de consentimento verbal do dono da voz, conferida contra o falante de referência. Todo clipe carrega marca d’água SynthID, e vozes replicadas recebem credenciais de conteúdo C2PA.
Desempenho e disponibilidade
Nos benchmarks divulgados pelo Google, o Flash TTS lidera o Hume AI Voice Design Benchmark com 71,4 pontos e também a modelagem de sotaque, com 60,8. No ranking cego do Voice Arena, os dois modelos ocupam as primeiras posições em japonês, português brasileiro, vietnamita, árabe padrão moderno, espanhol mexicano e hindi — um destaque relevante para quem produz conteúdo em português do Brasil.
Os modelos já estão em implantação pela Gemini API e pelo Google AI Studio, com identificadores gemini-3.8-flash-tts e gemini-3.8-flash-lite-tts. O acesso é apenas via API, sem pesos abertos para auto-hospedagem; o acesso corporativo via Gemini Enterprise está listado como “em breve”.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



