Inteligência artificial, sem ruído.
Ferramentas e Apps3 min

LangSmith agora rastreia agentes de voz com Pipecat, LiveKit, OpenAI e Gemini

LangChain lança integrações nativas em Python para rastrear agentes de voz em produção. Suporte a quatro frameworks populares.

LangSmith agora rastreia agentes de voz com Pipecat, LiveKit, OpenAI e Gemini

LangSmith agora rastreia agentes de voz: Pipecat, LiveKit, OpenAI Realtime e Gemini Live

A LangChain anunciou nesta terça-feira (21) integrações nativas em Python para rastrear agentes de voz no LangSmith, sua plataforma de observabilidade e avaliação. Quatro frameworks populares ganham suporte: Pipecat, LiveKit, OpenAI Realtime e Gemini Live com Google ADK.

O lançamento resolve um problema que vinha se intensificando à medida que agentes de voz ganham adoção em produção: como depurar, avaliar e melhorar sistemas onde a interação acontece por áudio, e não por texto.

O mercado de voz está acelerando

Agentes de voz estão se tornando práticos e o mercado cresce rapidamente, impulsionado por avanços em toda a pilha: modelos de detecção de atividade de voz mais precisos (reduzindo interrupções), modelos de fala mais naturais e expressivos, e LLMs rápidos o suficiente para conversas em tempo real. A LangChain aposta que, assim como aconteceu com agentes de texto, a observabilidade será o diferencial entre protótipos e sistemas de produção.

Duas arquiteturas, uma plataforma

O LangSmith suporta as duas principais arquiteturas de agentes de voz:

  • Arquitetura “sanduíche” (STT → LLM → TTS): o áudio do usuário é transcrito (speech-to-text), processado por um agente baseado em texto, e a resposta é sintetizada de volta para fala (text-to-speech). O LangSmith captura metadados, entradas e saídas de cada etapa, além de uma análise de latência entre STT, LLM e TTS — essencial para identificar gargalos.
  • Arquitetura speech-to-speech: o modelo multimodal processa áudio diretamente, emitindo áudio de resposta. A comunicação acontece via WebSocket bidirecional, com eventos de áudio, chamadas de ferramentas e detecção de interrupção. O LangSmith captura e inspeciona cada evento trafegado.

O que aparece no trace

Cada trace no LangSmith captura o ciclo completo de uma interação de voz: gravação do áudio da conversa, inferência de STT e TTS, destaques de interrupções, chamadas de ferramentas, estado do agente e contexto recuperado. Tudo organizado em uma árvore de trace única que permite seguir como a interação fluiu de áudio para ação do agente e resposta falada.

Cada integração exige apenas algumas linhas de código para começar a capturar traces. A LangChain também disponibiliza um exemplo funcional completo em github.com/langchain-ai/voice-demo.

Por que isso importa

Com a explosão de agentes de voz em 2026 — de assistentes de atendimento a agentes de vendas e suporte técnico — ferramentas de observabilidade que funcionam para texto não são suficientes. O LangSmith Voice Tracing estabelece um padrão de referência para o que significa “depurar um agente de voz” e é um movimento estratégico da LangChain para capturar o pipeline de desenvolvimento que vai além do chat tradicional.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.