A AWS anunciou a disponibilidade geral do TwelveLabs Marengo Embed 3.0 como modelo de embedding no Amazon Bedrock Knowledge Bases. Na prática, isso transforma a busca por conteúdo em vídeo, áudio e imagem em uma experiência totalmente gerenciada — sem precisar montar um pipeline próprio de transcrição, extração de frames, embeddings e banco vetorial.
O problema que isso resolve
Vídeo e mídia continuam em grande parte não pesquisáveis por significado. Times de mídia, análise esportiva, educação, segurança e varejo precisam encontrar momentos específicos em horas de gravação usando linguagem natural — como “mostre o pênalti do segundo tempo”. Montar isso hoje exige juntar serviços de transcrição, extração de frames, modelos de embedding, bancos vetoriais e lógica de sincronização. O Marengo Embed 3.0 é um modelo multimodal que codifica vídeo, áudio, imagem e texto em um espaço vetorial compacto de 512 dimensões.
Como funciona
O fluxo é simples: faça upload dos arquivos (MP4, MOV, JPEG, PNG, áudio) para um bucket S3, crie uma Knowledge Base gerenciada escolhendo o Marengo Embed 3.0 como modelo de embedding, e sincronize. O serviço segmenta o vídeo, amostra frames, transcreve o áudio, gera embeddings para cada segmento e grava os vetores no índice — tudo automaticamente. Depois, é só rodar consultas em linguagem natural: a resposta traz os trechos ranqueados com metadados como horário de início/fim do chunk, URI da fonte e tipo de embedding.
Casos de uso reais
- Análise esportiva: localizar jogadas, formações e ações de atletas em temporadas inteiras de gravação.
- Mídia e entretenimento: gestão de acervo e busca semântica em catálogos e serviços de streaming.
- Segurança: pesquisar imagens de câmeras por incidentes ou atividades específicas.
- Educação: achar trechos de aula por conceito, não apenas por palavra-chave.
- Varejo: buscar vídeos de demonstração de produto por recurso.
Disponibilidade e preço
O recurso está disponível nas regiões us-east-1 (N. Virginia) e us-west-1 (N. California). A cobrança segue o modelo de Knowledge Bases gerenciadas: você paga pelo que armazena e recupera, com a geração de embeddings cobrada na taxa padrão de invocação de modelo do Bedrock.
Por que isso importa: a busca semântica multimídia — antes um projeto de engenharia de meses — vira uma configuração de console. Isso destrava acervos inteiros de vídeo e imagem que hoje ficam subutilizados por não serem pesquisáveis.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



