Inteligência artificial, sem ruído.
Modelos e LLMs3 min

OpenAI Lança GPT-Live: Modelos de Voz Full-Duplex que Delegam Raciocínio ao GPT-5.5

OpenAI lança GPT-Live e GPT-Live-1 mini, modelos de voz full-duplex que delegam raciocínio profundo ao GPT-5.5 enquanto mantêm conversas naturais e interrupções em tempo real.

OpenAI Lança GPT-Live: Modelos de Voz Full-Duplex que Delegam Raciocínio ao GPT-5.5

A OpenAI liberou nesta terça-feira (8) o GPT-Live, uma nova família de modelos de voz com arquitetura full-duplex — capazes de ouvir e falar ao mesmo tempo. O lançamento substitui o Advanced Voice Mode no ChatGPT e chega em duas versões: GPT-Live-1 e GPT-Live-1 mini.

O que muda com o full-duplex

A diferença fundamental está na arquitetura. Os sistemas de voz anteriores (cascaded e turn-based) operavam em três etapas separadas: transcrição de fala (speech-to-text), processamento do modelo de linguagem e síntese de voz (text-to-speech). Cada etapa introduzia latência e impedia interrupções naturais.

O GPT-Live rompe com esse paradigma. Por ser full-duplex, ele pode emitir sinais de escuta ativa (“mhmm”, “sim”), reagir a interrupções e manter a conversa fluindo mesmo enquanto processa tarefas complexas em segundo plano.

Delegação ao GPT-5.5

O recurso mais poderoso do GPT-Live é a delegação de raciocínio. Quando o usuário faz uma pergunta que exige busca na web, raciocínio profundo ou trabalho complexo, o GPT-Live passa a tarefa para um modelo de fronteira — no lançamento, o GPT-5.5 — enquanto mantém a conversa ativa com dicas de contexto (“deixa eu pesquisar isso”).

Quando o GPT-5.5 termina, a resposta é costurada de volta ao diálogo de forma natural. É um salto de arquitetura que separa a camada conversacional da camada de raciocínio, permitindo que cada uma seja otimizada para sua função específica.

Duas versões disponíveis

  • GPT-Live-1: desempenho máximo, qualidade de voz superior, maior acurácia em contextos complexos.
  • GPT-Live-1 mini: latência reduzida, otimizado para conversas casuais e dispositivos com menos recursos computacionais.

Em testes com usuários humanos, ambas as versões foram fortemente preferidas em relação ao Advanced Voice Mode anterior.

O que NÃO está disponível no lançamento

A OpenAI foi transparente sobre as limitações da versão inicial:

  • Sem vídeo ou compartilhamento de tela — a funcionalidade multimodal completa ainda não está ativa.
  • Paridade multilíngue incompleta — o inglês tem cobertura total, mas outros idiomas ainda estão em desenvolvimento.
  • API ainda não disponível — o acesso é exclusivo pelo ChatGPT; a API para desenvolvedores está “planejada para breve”.

Por que isso importa

O GPT-Live representa a transição de assistentes de voz que “respondem quando chamados” para agentes conversacionais que participam ativamente do diálogo. A arquitetura de delegação a um modelo de fronteira resolve o trade-off histórico entre latência de conversa e profundidade de raciocínio — você não precisa mais escolher entre um e outro.

Para o ecossistema de desenvolvimento, a implicação mais relevante é que o GPT-5.5, mencionado como o modelo de raciocínio que opera nos bastidores, parece estar em produção interna. O anúncio da API deve ser o próximo capítulo dessa história.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.