Inteligência artificial, sem ruído.
Modelos e LLMs4 min

PolyAI lança Dialog-RSN-1: modelo de diálogo nativo em áudio que unifica turn-taking, reconhecimento de fala e chamadas de função

PolyAI lança Dialog-RSN-1, modelo que processa áudio diretamente sem transcrição, unificando turn-taking, ASR e function calling com latência abaixo de 300ms.

PolyAI lança Dialog-RSN-1: modelo de diálogo nativo em áudio que unifica turn-taking, reconhecimento de fala e chamadas de função

O que é o Dialog-RSN-1

A PolyAI acaba de lançar o Dialog-RSN-1, um modelo de diálogo que processa áudio diretamente — sem depender de transcrição prévia. O modelo unifica quatro capacidades em uma única arquitetura: detecção de turno de fala (turn-taking), reconhecimento de fala (ASR), chamada de funções (function calling) e geração de resposta. Ele já está em produção atendendo chamadas reais de clientes enterprise.

O diferencial do Dialog-RSN-1 está em ser audio-aware apenas na entrada: o modelo raciocina sobre o áudio bruto do interlocutor, mas mantém o TTS (síntese de voz) como um sistema separado e controlável. Isso significa que a voz de saída pode ser ajustada independentemente — uma vantagem importante para empresas que precisam manter identidade vocal consistente em diferentes mercados.

Por que isso importa agora

O mercado de IA conversacional por voz está em um ponto de inflexão. Modelos como GPT Realtime (OpenAI) e Gemini Live (Google) mostraram que é possível processar áudio nativamente, mas ambos “assam” a voz dentro do modelo — limitando o controle de pronúncia e sotaque. Arquiteturas em cascata tradicionais (ASR → LLM → TTS), por outro lado, perdem nuances como tom, hesitação e incerteza do interlocutor antes mesmo do LLM ver os dados.

O Dialog-RSN-1 propõe um caminho intermediário inteligente: áudio na entrada, texto/TTS na saída, acionado sob demanda em vez de manter uma GPU ocupada durante toda a chamada. O modelo não é streaming contínuo — ele é consultado apenas quando um VAD (Voice Activity Detection) de alta sensibilidade detecta que o interlocutor terminou de falar. O primeiro token da resposta decide se o agente deve falar ou continuar ouvindo: EMPTY (silêncio), ONGOING (interlocutor ainda falando) ou COMPLETE (pode responder).

Arquitetura e desempenho

A PolyAI fez pós-treinamento de modelos open-weight multimodais com fine-tuning supervisionado e por reforço usando dados proprietários. O pipeline é agnóstico ao modelo base — foram avaliados Gemma, GPT-OSS, Qwen e Mistral. Com a meta de resposta em menos de 300ms em GPUs A100, os candidatos ficam na faixa de 8B parâmetros (densos) a 30B (esparsos).

As otimizações de latência incluem:

  • Preenchimento antecipado do cache de atenção enquanto o usuário ainda fala
  • Template de prompt append-only que minimiza invalidação de cache
  • Roteamento sticky — cada interlocutor é sempre direcionado à mesma GPU
  • Speculative decoding com um drafter fine-tunado que atinge aceitação média de 3,9 tokens por passo
  • Auto-raciocínio aprendido durante o fine-tuning por reforço

A transcrição (ASR) roda por último, em paralelo com a geração de fala, após a resposta ou chamada de função já ter sido decidida — uma inversão inteligente do pipeline tradicional.

Resultados reportados

A PolyAI avaliou o modelo no Dialog-Eval, um benchmark interno que planeja abrir como open source. Cada exemplo é uma chamada truncada em um ponto de decisão, pontuando um único próximo passo atômico. O Dialog-RSN-1 foi o modelo com maior pontuação entre os capazes de operar em tempo real.

Em produção, a empresa reporta:

  • +11% de contenção relativa em uma rede de restaurantes (mais chamadas resolvidas sem transferência para humano)
  • −37% de latência em uma seguradora
  • Tempo de resposta abaixo de 300ms de forma consistente

Em transcrição, o gpt-4o-transcribe melhorou seu WER (Word Error Rate) de 7,8% para 6,9% quando recebeu o mesmo contexto — e o Dialog-RSN-1 ficou ainda abaixo disso.

Disponibilidade e limitações

O modelo está disponível apenas via plataforma PolyAI — sem pesos abertos, sem API pública no momento. Clientes existentes podem ativá-lo hoje; novos clientes precisam solicitar acesso antecipado. O público-alvo são grandes empresas com alto volume de chamadas: a PolyAI reporta mais de 100 clientes enterprise e 2.000 implantações ativas, tendo captado US$ 86 milhões em Série D em dezembro de 2025.

Setores atendidos: restaurantes, seguros, serviços financeiros, saúde, hotelaria, varejo, telecom, viagens e utilities. Aplicações: reservas, cobrança e pagamentos, autenticação, roteamento de chamadas, gestão de pedidos e troubleshooting.

Limitações importantes: apenas inglês no lançamento. Para outros idiomas e chat web, a PolyAI recomenda o Raven 3.5. Não há suporte para desenvolvedores independentes ou pequenas empresas no momento.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.