Inteligência artificial, sem ruído.
Modelos e LLMs4 min

ByteDance Seed apresenta SeedRealtime: LLM nativo de áudio e vídeo que ouve, vê e fala em um só modelo

ByteDance Seed revela SeedRealtime, modelo full-duplex que processa áudio, vídeo e texto em paralelo. Já está no ar no app Doubao, mas sem API pública, pesos abertos ou relatório técnico.

ByteDance Seed apresenta SeedRealtime: LLM nativo de áudio e vídeo que ouve, vê e fala em um só modelo

O que é o SeedRealtime

A ByteDance, empresa controladora do TikTok, revelou nesta semana o SeedRealtime — um modelo de linguagem multimodal que processa áudio, vídeo e texto simultaneamente em uma única arquitetura unificada. Diferente dos sistemas tradicionais que encadeiam reconhecimento de fala (ASR), modelo de visão (VLM) e síntese de voz (TTS) em etapas sequenciais, o SeedRealtime executa percepção, compreensão, tomada de decisão e expressão em paralelo, de ponta a ponta.

A equipe Seed da ByteDance posiciona o modelo como um avanço rumo à interação omni-modal — aquela em que a IA não apenas entende comandos isolados, mas participa de conversas contínuas olhando, ouvindo e falando como um interlocutor humano. O SeedRealtime já está disponível dentro do aplicativo Doubao, o assistente de consumo da ByteDance na China.

O que muda na arquitetura

O pipeline tradicional em cascata — ASR → VLM → TTS — tem dois problemas conhecidos: latência acumulada entre estágios e perda de informação a cada passagem. O SeedRealtime elimina esses gargalos ao rodar tudo dentro de um único modelo. A decisão de quando falar (turn-taking) também migra para dentro do modelo, dispensando o detector de atividade de voz (VAD) externo que a maioria das stacks em tempo real ainda utiliza.

A ByteDance reivindica três avanços com essa abordagem: compreensão audiovisual conjunta, interação proativa (o modelo toma iniciativa em vez de apenas responder) e tempo de conversa natural, mais próximo do ritmo humano. Em avaliações internas, a empresa reporta que problemas de ritmo de conversa foram reduzidos pela metade em comparação com sistemas em cascata — embora não tenha publicado benchmarks ou números de latência.

Quatro cenários que mostram o salto

A Seed publicou sete demonstrações. Quatro delas merecem destaque pelo que revelam de novo:

  1. Vinculação de identidade entre modalidades: em um jantar com várias pessoas, o modelo associa nomes a rostos conforme as apresentações acontecem, mantém cada voz vinculada à identidade correta e — após ouvir preferências conflitantes de viagem — propõe um plano que considera o que cada um disse.
  2. Fala proativa por instrução prévia: no Museu de Hebei, um usuário pede para ser avisado quando um suporte de tela de bronze específico aparecer. A câmera continua percorrendo o ambiente; o modelo assiste em silêncio e fala sozinho quando a peça entra no quadro. O mesmo comportamento aparece com um artigo acadêmico — o modelo acompanha páginas sendo viradas rapidamente, identifica a seção “3.4 Implementation”, pausa por conta própria e lê em voz alta os hiperparâmetros.
  3. Correção a partir do estado visual: acompanhando o preparo de um espresso, o modelo interrompe quando grãos inteiros vão para o porta-filtro (em vez de moídos) e depois lê a cor e o volume da crema para sugerir encurtar a extração em 2 a 3 segundos.
  4. Supressão de interferência e memória fora de tela: no Aeroporto de Beijing Daxing, conversas irrelevantes sobre voos não disparam respostas. Quando o usuário de fato pergunta, o modelo responde com informações do quadro de partidas que já saiu da tela e ainda busca online a localização da esteira de bagagens.

Dá para usar?

A resposta curta é: parcialmente. O SeedRealtime está funcionando dentro do Doubao, mas a ByteDance não publicou relatório técnico, não revelou número de parâmetros, não liberou pesos abertos e não anunciou API — seja via Volcano Engine ou BytePlus. Para times de terceiros, o que está disponível agora é a ideia: uma arquitetura de referência validada e um novo patamar para quem está construindo produtos de voz com câmera em tempo real.

O lançamento chega em um momento de aceleração na corrida por modelos de fala full-duplex. A NVIDIA havia anunciado dias antes o NemotronLabs VoiceChat 11B, um modelo aberto de fala-para-fala com ~450 ms de latência e suporte a tool calling ao vivo. A diferença é que o modelo da NVIDIA tem pesos abertos, enquanto o da ByteDance é uma demonstração de capacidade dentro de um produto fechado.



Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.