Quando o preenchimento (prefill) e a decodificação (decode) compartilham a mesma GPU em servidores de LLMs, prompts longos travam a geração de tokens para cada requisição simultânea. É como se um cliente pedindo um banquete bloqueasse a cozinha inteira, deixando todos os outros clientes esperando. A técnica de Disaggregated Prefill and Decode (DPD) resolve esse problema executando cada fase em pools de GPU separados, conectados por rede de alta velocidade Elastic Fabric Adapter (EFA) com RDMA.
Por que isso importa agora
Com a explosão de aplicações de IA generativa em produção — chatbots, agentes autônomos, sistemas RAG com contextos enormes — a latência de inferência se tornou o gargalo crítico. A AWS acaba de disponibilizar DPD nativo no SageMaker HyperPod usando o operador de inferência HyperPod com vLLM e LMCache. Isso significa que organizações podem implantar separação prefill/decode em escala sem reinventar a infraestrutura.
Como funciona na prática
A arquitetura tem três componentes principais:
- Roteador inteligente: tokeniza cada prompt e decide, com base em um limiar configurável, se a requisição segue o caminho desagregado (prefiller → decoder) ou vai direto para o decoder. Prompts curtos pulam a transferência de KV cache, que não valeria a pena.
- Pod de prefill: um worker vLLM com LMCache que computa o KV cache para prompts longos e o transfere via RDMA para o decoder, sobrepondo computação e transferência para manter as GPUs saturadas.
- Pod de decode: outro worker vLLM que apenas gera tokens, com latência estável mesmo sob alta concorrência, porque nunca executa prefill.
Quando adotar DPD
O DPD traz os maiores ganhos para cargas de trabalho de streaming com contexto longo e alta concorrência: assistentes de chat, pipelines agentivas, endpoints de análise de documentos e RAG com contextos recuperados grandes. Se seus prompts de entrada regularmente excedem 4.096 tokens e há múltiplos usuários simultâneos, o DPD elimina por construção os picos de latência por token que ocorrem em deploys colocalizados.
Para cargas batch ou de baixa concorrência com prompts curtos, um deploy colocalizado tradicional continua sendo a escolha mais simples. O roteador DPD lida automaticamente com tráfego misto, enviando prompts curtos direto ao decoder.
O que muda para times de ML no Brasil
Para empresas brasileiras que operam chatbots com alta demanda ou sistemas RAG com documentos extensos (como análise de contratos jurídicos ou relatórios financeiros), o DPD no HyperPod elimina a necessidade de fazer tuning manual de chunked prefill e oferece controle independente sobre o tempo até o primeiro token (TTFT) e a latência entre tokens (ITL). A transferência de KV cache sobre EFA com RDMA adiciona milissegundos de latência — insignificante comparado ao ganho de estabilidade.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.


