Transcrição inteligente, não apenas fala-para-texto
O Google lançou o Gemini 3.5 Transcribe, seu modelo de fala-para-texto mais preciso até agora, projetado para interações de voz inteligentes. Diferente dos modelos de reconhecimento de fala convencionais — que sofrem com ruído de fundo, jargões complexos e a limpeza de disfluências —, o Gemini 3.5 Transcribe converte áudio bruto diretamente em texto preciso, polido e formatado.
A tecnologia já está em produção em produtos do Google, como o recurso Rambler no Android e o app Gemini no macOS. Agora, desenvolvedores podem construir capacidades semelhantes pela Gemini API, no Google AI Studio e no Gemini Enterprise Agent Platform.
Dois modos de API
O modelo está disponível em duas APIs separadas:
- Streaming em tempo real: streaming contínuo e bidirecional com latência abaixo de um segundo para apps de voz interativos, via Live API (
gemini-3.5-transcribe-live). - Áudio pré-gravado: transcreve reuniões, registros de chamadas e gravações com atribuição de falantes e timestamps em nível de palavra, via Interactions API (
gemini-3.5-transcribe).
Recursos que fazem diferença
A transcrição inteligente lida com autocorreções (“vamos nos encontrar terça — não, quarta”), remove palavras de preenchimento (“é”, “hã”, “né”) e formata o texto automaticamente. O modelo também faz function calling, delegando tarefas complexas (como geração de imagens e análise de arquivos) a outros modelos Gemini.
Nos números medidos pela Artificial Analysis, o modelo atinge uma taxa de erro de palavra (WER) média de 4,0% em streaming e 2,6% em casos não-streaming. O tempo até a transcrição final melhorou 70% em relação ao modelo anterior (Chirp 3). O suporte cobre mais de 85 idiomas, com detecção automática, e identifica até três falantes em áudio gravado.
Onde já dá para usar
No Gboard do Android, o Rambler transforma fala em texto formatado, filtrando palavras de preenchimento e permitindo edições por voz. No Google Antigravity, o modelo combina contexto de tela e histórico de conversa para maior precisão. Em breve, chega ao Chrome para “falar para digitar” em qualquer campo da web. Para empresas, está em prévia pública no Gemini Enterprise Agent Platform, com suporte em plataformas como LiveKit, Vercel, LangChain e Agora.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



