Escolher a API de inferência certa para um agente de voz costuma começar por uma única métrica: o time to first token (TTFT), o intervalo entre enviar a requisição e receber o primeiro token de volta. É também a métrica que mais engana. Um benchmark publicado pelo MarkTechPost mostra por quê: para voz, o TTFT marca apenas o início da geração — mas um modelo de texto-para-fala não consegue “falar” até que uma frase completa chegue. Entre esses dois pontos está a diferença entre um agente que soa natural e um que é interrompido o tempo todo.
Por que o TTFT é o ponto de partida errado
Um agente de voz é, na prática, um orçamento de latência com um modelo de linguagem dentro. Cada etapa gasta milissegundos que o usuário ouve. Para chat, o TTFT conta quase toda a história. Para voz, ele é apenas um termo de uma soma.
O motivo é mecânico: um modelo de texto-para-fala (TTS) não sintetiza meia palavra. Ele precisa de uma oração completa antes de produzir áudio. Por isso a LiveKit criou a métrica time-to-first-sentence (TTFS) — o que o usuário realmente sente. São dois botões, não um: o TTFT controla quando a geração começa, e os tokens por segundo controlam quão rápido a primeira frase se completa. Um provedor que vence em um e perde no outro não parecerá rápido.
O orçamento de latência de uma rodada de voz
Segundo a documentação da LiveKit, uma rodada de voz se decompõe em: reconhecimento de fala (STT) de 100–200 ms, LLM de 300–500 ms com streaming, TTS de 100–200 ms e rede de 50–150 ms via WebRTC. O alvo prático de ponta a ponta fica em 700 ms a 1,2 s. O co-criador do Pipecat, Kwindla Hultman Kramer, recomenda mirar 800 ms de latência mediana voz-a-voz. O tempo de resposta humano em conversa é de cerca de 500 ms — pausas acima de 800 ms começam a soar artificiais.
Os números do benchmark
As tabelas abaixo vêm do leaderboard da Artificial Analysis, recuperado em 30 de agosto de 2026, com workload de 10 mil tokens de entrada.
| Provedor | Modelo | TTFT | Velocidade |
|---|---|---|---|
| Baseten | gpt-oss-120b (high) | 0,23s | 266 tok/s |
| DeepInfra | Nemotron 3 Ultra | 0,28s | 371 tok/s |
| Cohere | North Mini Code | 0,32s | 104 tok/s |
| Modular | Gemma 4 31B (NVFP4) | 0,44s | 243 tok/s |
| Fireworks | Nemotron 3.5 Lightning | 0,46s | 501 tok/s |
| Cerebras | gpt-oss-120b (high) | 0,49s | 1.697 tok/s |
A armadilha do throughput
Vendedores de silício otimizam para uma métrica diferente da que os agentes de voz precisam. O exemplo mais claro é o Mercury 2, da Inception: um modelo de linguagem baseado em difusão que gera 770 tokens por segundo, mas cujo primeiro chunk chega em 3,07 s — quatro vezes o orçamento inteiro de LLM de uma conversa natural. Já Cerebras e Groq combinam TTFT respeitável com throughput excepcional, o que é forte para TTFS.
| Provedor | Modelo | TTFT |
|---|---|---|
| Amazon Bedrock | GPT-5.6 Luna (non-reasoning) | 0,59s |
| Amazon Bedrock | GPT-5.6 Terra | 0,72s |
| OpenAI | GPT-5.6 Luna | 0,74s |
| Gemini 3.7 Flash (low) | 0,84s | |
| Anthropic | Claude 4.5 Haiku | 0,84s |
As quatro camadas da voz
O benchmark percorre toda a pilha. No STT, a latência não é a velocidade de transcrição, mas quanto tempo depois de o usuário parar de falar o pipeline percebe isso. O Deepgram Flux incorpora a detecção de fim de turno no próprio modelo de reconhecimento, cortando de 200 a 600 ms versus um pipeline STT + VAD tradicional. No TTS, as promessas dos fornecedores divergem do que o usuário sente: o “75 ms” da ElevenLabs Flash v2.5 é apenas tempo de inferência do modelo, sem rede nem buffering do player (comum: 500 ms). No speech-to-speech, o destaque é o Grok Voice Think Fast 2.0 High, com 0,70 s de time-to-first-audio (TTFA) e 97% de raciocínio de fala.
O que levar disso
Quatro conclusões práticas: (1) escolha a métrica que limita a sua arquitetura — com TTS a jusante, otimize TTFS, não TTFT; (2) colocalize antes de otimizar modelos, o que a LiveKit classifica como impacto “muito alto”, acima da escolha do modelo; (3) limite o esforço de raciocínio explicitamente — é a maior alavanca das tabelas (o Gemini 3.1 Flash Live vai de 0,96 s para 2,99 s entre os modos Minimal e High); e (4) meça o p95, não apenas a mediana, porque é na cauda que os agentes de voz quebram.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



