O que é o Dialog-RSN-1
A PolyAI acaba de lançar o Dialog-RSN-1, um modelo de diálogo que processa áudio diretamente — sem depender de transcrição prévia. O modelo unifica quatro capacidades em uma única arquitetura: detecção de turno de fala (turn-taking), reconhecimento de fala (ASR), chamada de funções (function calling) e geração de resposta. Ele já está em produção atendendo chamadas reais de clientes enterprise.
O diferencial do Dialog-RSN-1 está em ser audio-aware apenas na entrada: o modelo raciocina sobre o áudio bruto do interlocutor, mas mantém o TTS (síntese de voz) como um sistema separado e controlável. Isso significa que a voz de saída pode ser ajustada independentemente — uma vantagem importante para empresas que precisam manter identidade vocal consistente em diferentes mercados.
Por que isso importa agora
O mercado de IA conversacional por voz está em um ponto de inflexão. Modelos como GPT Realtime (OpenAI) e Gemini Live (Google) mostraram que é possível processar áudio nativamente, mas ambos “assam” a voz dentro do modelo — limitando o controle de pronúncia e sotaque. Arquiteturas em cascata tradicionais (ASR → LLM → TTS), por outro lado, perdem nuances como tom, hesitação e incerteza do interlocutor antes mesmo do LLM ver os dados.
O Dialog-RSN-1 propõe um caminho intermediário inteligente: áudio na entrada, texto/TTS na saída, acionado sob demanda em vez de manter uma GPU ocupada durante toda a chamada. O modelo não é streaming contínuo — ele é consultado apenas quando um VAD (Voice Activity Detection) de alta sensibilidade detecta que o interlocutor terminou de falar. O primeiro token da resposta decide se o agente deve falar ou continuar ouvindo: EMPTY (silêncio), ONGOING (interlocutor ainda falando) ou COMPLETE (pode responder).
Arquitetura e desempenho
A PolyAI fez pós-treinamento de modelos open-weight multimodais com fine-tuning supervisionado e por reforço usando dados proprietários. O pipeline é agnóstico ao modelo base — foram avaliados Gemma, GPT-OSS, Qwen e Mistral. Com a meta de resposta em menos de 300ms em GPUs A100, os candidatos ficam na faixa de 8B parâmetros (densos) a 30B (esparsos).
As otimizações de latência incluem:
- Preenchimento antecipado do cache de atenção enquanto o usuário ainda fala
- Template de prompt append-only que minimiza invalidação de cache
- Roteamento sticky — cada interlocutor é sempre direcionado à mesma GPU
- Speculative decoding com um drafter fine-tunado que atinge aceitação média de 3,9 tokens por passo
- Auto-raciocínio aprendido durante o fine-tuning por reforço
A transcrição (ASR) roda por último, em paralelo com a geração de fala, após a resposta ou chamada de função já ter sido decidida — uma inversão inteligente do pipeline tradicional.
Resultados reportados
A PolyAI avaliou o modelo no Dialog-Eval, um benchmark interno que planeja abrir como open source. Cada exemplo é uma chamada truncada em um ponto de decisão, pontuando um único próximo passo atômico. O Dialog-RSN-1 foi o modelo com maior pontuação entre os capazes de operar em tempo real.
Em produção, a empresa reporta:
- +11% de contenção relativa em uma rede de restaurantes (mais chamadas resolvidas sem transferência para humano)
- −37% de latência em uma seguradora
- Tempo de resposta abaixo de 300ms de forma consistente
Em transcrição, o gpt-4o-transcribe melhorou seu WER (Word Error Rate) de 7,8% para 6,9% quando recebeu o mesmo contexto — e o Dialog-RSN-1 ficou ainda abaixo disso.
Disponibilidade e limitações
O modelo está disponível apenas via plataforma PolyAI — sem pesos abertos, sem API pública no momento. Clientes existentes podem ativá-lo hoje; novos clientes precisam solicitar acesso antecipado. O público-alvo são grandes empresas com alto volume de chamadas: a PolyAI reporta mais de 100 clientes enterprise e 2.000 implantações ativas, tendo captado US$ 86 milhões em Série D em dezembro de 2025.
Setores atendidos: restaurantes, seguros, serviços financeiros, saúde, hotelaria, varejo, telecom, viagens e utilities. Aplicações: reservas, cobrança e pagamentos, autenticação, roteamento de chamadas, gestão de pedidos e troubleshooting.
Limitações importantes: apenas inglês no lançamento. Para outros idiomas e chat web, a PolyAI recomenda o Raven 3.5. Não há suporte para desenvolvedores independentes ou pequenas empresas no momento.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



