A OpenAI liberou nesta terça-feira (8) o GPT-Live, uma nova família de modelos de voz com arquitetura full-duplex — capazes de ouvir e falar ao mesmo tempo. O lançamento substitui o Advanced Voice Mode no ChatGPT e chega em duas versões: GPT-Live-1 e GPT-Live-1 mini.
O que muda com o full-duplex
A diferença fundamental está na arquitetura. Os sistemas de voz anteriores (cascaded e turn-based) operavam em três etapas separadas: transcrição de fala (speech-to-text), processamento do modelo de linguagem e síntese de voz (text-to-speech). Cada etapa introduzia latência e impedia interrupções naturais.
O GPT-Live rompe com esse paradigma. Por ser full-duplex, ele pode emitir sinais de escuta ativa (“mhmm”, “sim”), reagir a interrupções e manter a conversa fluindo mesmo enquanto processa tarefas complexas em segundo plano.
Delegação ao GPT-5.5
O recurso mais poderoso do GPT-Live é a delegação de raciocínio. Quando o usuário faz uma pergunta que exige busca na web, raciocínio profundo ou trabalho complexo, o GPT-Live passa a tarefa para um modelo de fronteira — no lançamento, o GPT-5.5 — enquanto mantém a conversa ativa com dicas de contexto (“deixa eu pesquisar isso”).
Quando o GPT-5.5 termina, a resposta é costurada de volta ao diálogo de forma natural. É um salto de arquitetura que separa a camada conversacional da camada de raciocínio, permitindo que cada uma seja otimizada para sua função específica.
Duas versões disponíveis
- GPT-Live-1: desempenho máximo, qualidade de voz superior, maior acurácia em contextos complexos.
- GPT-Live-1 mini: latência reduzida, otimizado para conversas casuais e dispositivos com menos recursos computacionais.
Em testes com usuários humanos, ambas as versões foram fortemente preferidas em relação ao Advanced Voice Mode anterior.
O que NÃO está disponível no lançamento
A OpenAI foi transparente sobre as limitações da versão inicial:
- Sem vídeo ou compartilhamento de tela — a funcionalidade multimodal completa ainda não está ativa.
- Paridade multilíngue incompleta — o inglês tem cobertura total, mas outros idiomas ainda estão em desenvolvimento.
- API ainda não disponível — o acesso é exclusivo pelo ChatGPT; a API para desenvolvedores está “planejada para breve”.
Por que isso importa
O GPT-Live representa a transição de assistentes de voz que “respondem quando chamados” para agentes conversacionais que participam ativamente do diálogo. A arquitetura de delegação a um modelo de fronteira resolve o trade-off histórico entre latência de conversa e profundidade de raciocínio — você não precisa mais escolher entre um e outro.
Para o ecossistema de desenvolvimento, a implicação mais relevante é que o GPT-5.5, mencionado como o modelo de raciocínio que opera nos bastidores, parece estar em produção interna. O anúncio da API deve ser o próximo capítulo dessa história.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



