Inteligência artificial, sem ruído.
Ferramentas e Apps3 min

Amazon Bedrock ganha busca por vídeo e imagem com o Marengo Embed 3.0 da TwelveLabs

Modelo multimodal da TwelveLabs chega ao Amazon Bedrock Knowledge Bases e torna vídeo, áudio e imagem pesquisáveis por linguagem natural.

Amazon Bedrock ganha busca por vídeo e imagem com o Marengo Embed 3.0 da TwelveLabs

A AWS anunciou a disponibilidade geral do TwelveLabs Marengo Embed 3.0 como modelo de embedding no Amazon Bedrock Knowledge Bases. Na prática, isso transforma a busca por conteúdo em vídeo, áudio e imagem em uma experiência totalmente gerenciada — sem precisar montar um pipeline próprio de transcrição, extração de frames, embeddings e banco vetorial.

O problema que isso resolve

Vídeo e mídia continuam em grande parte não pesquisáveis por significado. Times de mídia, análise esportiva, educação, segurança e varejo precisam encontrar momentos específicos em horas de gravação usando linguagem natural — como “mostre o pênalti do segundo tempo”. Montar isso hoje exige juntar serviços de transcrição, extração de frames, modelos de embedding, bancos vetoriais e lógica de sincronização. O Marengo Embed 3.0 é um modelo multimodal que codifica vídeo, áudio, imagem e texto em um espaço vetorial compacto de 512 dimensões.

Como funciona

O fluxo é simples: faça upload dos arquivos (MP4, MOV, JPEG, PNG, áudio) para um bucket S3, crie uma Knowledge Base gerenciada escolhendo o Marengo Embed 3.0 como modelo de embedding, e sincronize. O serviço segmenta o vídeo, amostra frames, transcreve o áudio, gera embeddings para cada segmento e grava os vetores no índice — tudo automaticamente. Depois, é só rodar consultas em linguagem natural: a resposta traz os trechos ranqueados com metadados como horário de início/fim do chunk, URI da fonte e tipo de embedding.

Casos de uso reais

  • Análise esportiva: localizar jogadas, formações e ações de atletas em temporadas inteiras de gravação.
  • Mídia e entretenimento: gestão de acervo e busca semântica em catálogos e serviços de streaming.
  • Segurança: pesquisar imagens de câmeras por incidentes ou atividades específicas.
  • Educação: achar trechos de aula por conceito, não apenas por palavra-chave.
  • Varejo: buscar vídeos de demonstração de produto por recurso.

Disponibilidade e preço

O recurso está disponível nas regiões us-east-1 (N. Virginia) e us-west-1 (N. California). A cobrança segue o modelo de Knowledge Bases gerenciadas: você paga pelo que armazena e recupera, com a geração de embeddings cobrada na taxa padrão de invocação de modelo do Bedrock.

Por que isso importa: a busca semântica multimídia — antes um projeto de engenharia de meses — vira uma configuração de console. Isso destrava acervos inteiros de vídeo e imagem que hoje ficam subutilizados por não serem pesquisáveis.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.