A OpenAI lançou dois novos modelos Realtime em sua API: gpt-realtime-2.1 e gpt-realtime-2.1-mini. Ambos são voltados para experiências de voz e multimodais de baixa latência, com o modelo mini sendo a grande novidade: é o primeiro modelo de raciocínio compacto para voz em tempo real da empresa — e chega pelo mesmo custo do gpt-realtime-mini anterior.
O que é o GPT-Realtime-2.1-mini
O gpt-realtime-2.1-mini é um modelo de raciocínio compacto para interações de voz em tempo real. Ele responde a entradas de áudio e texto em uma conexão ao vivo, sendo posicionado pela OpenAI como a opção mais rápida e econômica da linha.
A API Realtime processa e gera áudio por meio de um único modelo, eliminando a necessidade de encadear sistemas separados de speech-to-text e text-to-speech. Esse design de modelo único reduz a latência e preserva as nuances da fala — o que é essencial para criar agentes de voz que soam naturais.
O grande diferencial aqui é o raciocínio: o modelo pode “pensar” internamente antes de falar. A versão mini também oferece suporte a tool use (function calling) pela API Realtime, permitindo que o agente planeje uma etapa, chame sua função e depois responda — tudo em tempo real.
GPT-Realtime-2.1: a versão completa
O modelo maior, gpt-realtime-2.1, atualiza o GPT-Realtime-2 com melhorias significativas em reconhecimento alfanumérico, tratamento de silêncio e ruído, e comportamento de interrupção. Ele oferece speech-to-speech com esforço de raciocínio configurável, seguimento de instruções e uso de ferramentas.
A escolha entre os dois modelos é direta: use o gpt-realtime-2.1 quando quiser o raciocínio mais forte em tempo real, com tool use, seguimento de instruções e comportamento de agente de voz completo. Use o gpt-realtime-2.1-mini quando precisar de uma opção mais rápida e econômica, mas ainda com capacidade de raciocínio.
Por que raciocínio e tool use importam aqui
Agentes de voz frequentemente travam durante chamadas de ferramentas. O modelo dispara uma function call e fica em silêncio. Os usuários assumem que a chamada caiu e interrompem, gerando resultados parciais e estado de conversa confuso.
O raciocínio resolve esse padrão: o modelo pode dizer “vou verificar esse pedido agora” antes de agir. Ele continua falando enquanto processa a requisição, mantendo tarefas de voz com múltiplas etapas coerentes.
O esforço de raciocínio é configurável em cinco níveis: minimal, low, medium, high e xhigh. O nível low é o padrão e mantém a latência baixa para interações simples. Níveis mais altos aumentam a latência e o consumo de tokens de saída. A recomendação da OpenAI é começar com low para a maioria dos agentes de voz em produção.
Redução de latência e cache
A latência p95 (tempo de resposta no percentil 95, que captura a “cauda lenta” que o usuário realmente sente) foi reduzida em pelo menos 25% em todos os modelos Realtime. Essa melhoria vem de um sistema de cache aprimorado.
O cache também reduz o custo, não apenas a latência. Tokens de entrada cacheados são cobrados com desconto significativo. Para o gpt-realtime-2.1-mini, o áudio de entrada cacheado custa US$ 0,30 por 1M de tokens, contra US$ 10,00 por 1M para áudio novo. Sessões longas se beneficiam mais, pois o system prompt é cacheado após a primeira interação.
Preços e comparação
| Modelo | Áudio (saída) | Áudio (entrada) | Áudio cache (entrada) | Texto (saída) | Texto (entrada) |
|---|---|---|---|---|---|
| gpt-realtime-2.1-mini | US$ 20,00 | US$ 10,00 | US$ 0,30 | US$ 1,80 | US$ 0,60 |
| gpt-realtime-2.1 | US$ 64,00 | US$ 32,00 | US$ 2,50 | US$ 5,00 | US$ 1,25 |
A diferença de preço é expressiva: o modelo mini custa cerca de 3× menos na saída de áudio que a versão completa. Times podem trocar parte da capacidade por custo menor, mantendo o raciocínio.
Casos de uso práticos
Triagem de suporte ao cliente: um cliente relata um erro de cobrança por telefone. O modelo mini raciocina sobre o problema com esforço baixo, chama uma ferramenta lookup_account e depois check_invoice, narrando cada etapa para manter o cliente informado.
Agendamento de consultas: o usuário pede para mover um compromisso para terça-feira. O modelo captura a data exata caractere por caractere, confirma os detalhes e chama uma função de reagendamento. A precisão alfanumérica evita chamadas de ferramenta com dados incorretos.
Assistente de voz in-app: um app móvel transmite áudio do microfone via WebRTC. O modelo mini responde perguntas sobre produtos em uma ou duas frases curtas. O custo mais baixo permite rodar o recurso em alto volume.
Captura de dados em campo: um técnico pede ao agente para registrar um número de peça. O reconhecimento alfanumérico aprimorado ajuda a capturar códigos como “8-3-5-7-1”. O modelo lê o valor de volta para confirmação antes de agir.
Implementação mínima
Clientes de navegador conectam-se via WebRTC. Seu servidor gera um client secret de curta duração primeiro, e o navegador então se conecta diretamente à API Realtime. Pipelines de mídia no servidor usam WebSockets, e telefonia usa SIP.
O fluxo básico: o servidor cria um client secret efêmero (mantenha sua API key padrão no servidor), a configuração da sessão define o modelo, esforço de raciocínio baixo e uma ferramenta. O navegador então abre uma conexão peer WebRTC, adiciona a track do microfone e um data channel para eventos, e envia sua oferta SDP ao endpoint de calls.
A recomendação da OpenAI é começar com esforço de raciocínio low e aumentar apenas para tarefas mais difíceis. Adicione instruções curtas que separem regras rígidas de padrões, e execute avaliações antes e depois de qualquer migração de modelo.
Pontos fortes e limitações
✅ O que você ganha:
- Raciocínio agora disponível no tier mini de baixo custo
- Preço igual ao gpt-realtime-mini anterior, mas com reasoning
- Latência p95 reduzida em pelo menos 25% em todos os modelos de voz
- Esforço de raciocínio configurável (5 níveis) para equilibrar latência e profundidade
- Pipeline de áudio em modelo único preserva a naturalidade da conversa
- Tool use com narração evita o “silêncio da function call” que confunde usuários
⚠️ Limitações:
- Custo de tokens de áudio é difícil de converter em custo por chamada
- Esforço de raciocínio mais alto aumenta tanto a latência quanto os tokens de saída
- Sessões longas reenviam contexto e aumentam o custo de entrada sem poda automática
- O tier mini troca parte da capacidade em relação ao gpt-realtime-2.1 completo
Com este lançamento, a OpenAI coloca o raciocínio em tempo real ao alcance de aplicações com orçamento mais restrito — um movimento que deve acelerar a adoção de agentes de voz em produção. A combinação de menor latência, cache inteligente e preço acessível no tier mini torna viável escalar assistentes de voz que realmente “pensam” antes de responder.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



