LangSmith agora rastreia agentes de voz: Pipecat, LiveKit, OpenAI Realtime e Gemini Live
A LangChain anunciou nesta terça-feira (21) integrações nativas em Python para rastrear agentes de voz no LangSmith, sua plataforma de observabilidade e avaliação. Quatro frameworks populares ganham suporte: Pipecat, LiveKit, OpenAI Realtime e Gemini Live com Google ADK.
O lançamento resolve um problema que vinha se intensificando à medida que agentes de voz ganham adoção em produção: como depurar, avaliar e melhorar sistemas onde a interação acontece por áudio, e não por texto.
O mercado de voz está acelerando
Agentes de voz estão se tornando práticos e o mercado cresce rapidamente, impulsionado por avanços em toda a pilha: modelos de detecção de atividade de voz mais precisos (reduzindo interrupções), modelos de fala mais naturais e expressivos, e LLMs rápidos o suficiente para conversas em tempo real. A LangChain aposta que, assim como aconteceu com agentes de texto, a observabilidade será o diferencial entre protótipos e sistemas de produção.
Duas arquiteturas, uma plataforma
O LangSmith suporta as duas principais arquiteturas de agentes de voz:
- Arquitetura “sanduíche” (STT → LLM → TTS): o áudio do usuário é transcrito (speech-to-text), processado por um agente baseado em texto, e a resposta é sintetizada de volta para fala (text-to-speech). O LangSmith captura metadados, entradas e saídas de cada etapa, além de uma análise de latência entre STT, LLM e TTS — essencial para identificar gargalos.
- Arquitetura speech-to-speech: o modelo multimodal processa áudio diretamente, emitindo áudio de resposta. A comunicação acontece via WebSocket bidirecional, com eventos de áudio, chamadas de ferramentas e detecção de interrupção. O LangSmith captura e inspeciona cada evento trafegado.
O que aparece no trace
Cada trace no LangSmith captura o ciclo completo de uma interação de voz: gravação do áudio da conversa, inferência de STT e TTS, destaques de interrupções, chamadas de ferramentas, estado do agente e contexto recuperado. Tudo organizado em uma árvore de trace única que permite seguir como a interação fluiu de áudio para ação do agente e resposta falada.
Cada integração exige apenas algumas linhas de código para começar a capturar traces. A LangChain também disponibiliza um exemplo funcional completo em github.com/langchain-ai/voice-demo.
Por que isso importa
Com a explosão de agentes de voz em 2026 — de assistentes de atendimento a agentes de vendas e suporte técnico — ferramentas de observabilidade que funcionam para texto não são suficientes. O LangSmith Voice Tracing estabelece um padrão de referência para o que significa “depurar um agente de voz” e é um movimento estratégico da LangChain para capturar o pipeline de desenvolvimento que vai além do chat tradicional.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



