Inteligência artificial, sem ruído.
Tutoriais3 min

Como remover dados pessoais de imagens automaticamente com Amazon Nova

Um pipeline multi-etapas coordenado pelo Amazon Nova combina visão contextual com o Segment Anything Model (SAM) da Meta para identificar e borrar automaticamente informações pessoais em imagens — RG, placas de carro, rostos e muito mais.

Como remover dados pessoais de imagens automaticamente com Amazon Nova

Remover informações pessoais de documentos digitalizados, fotos e capturas de tela é um desafio comum em compliance, saúde, finanças e setor público. A AWS acaba de publicar uma solução que combina Amazon Nova (seu modelo de visão) com o Segment Anything Model (SAM) da Meta para criar um pipeline de redação automática de PII em imagens.

Como funciona o pipeline

  1. Amazon Nova analisa a imagem: usando raciocínio visual contextual, o modelo identifica regiões com PII — números de documentos, placas de veículos, rostos, assinaturas, códigos de barras
  2. SAM segmenta as regiões: o modelo da Meta recebe as coordenadas do Nova e gera máscaras precisas sobre as áreas sensíveis
  3. Redação é aplicada: as regiões mascaradas recebem blur, tarja preta ou pixelização
  4. Imagem final é salva: versão sanitizada com todos os dados sensíveis removidos

Requisitos

ComponenteMínimoRecomendado
Conta AWSFree tierCom acesso ao Bedrock
ModelosAmazon Nova (via Bedrock)Nova + SAM
Permissõesbedrock:InvokeModelIAM role com S3 e Bedrock
ConhecimentoPython básicoFamiliaridade com boto3
Requisitos para implementar o pipeline

Tipos de PII detectáveis

  • Documentos de identidade: RG, CPF, CNH, passaportes
  • Placas de veículos: reconhecimento de padrões Mercosul e anteriores
  • Rostos: detecção facial com blur seletivo
  • Assinaturas: identificação de campos de assinatura
  • Cartões: números de crédito visíveis em fotos

Passo a passo simplificado

import boto3, json
bedrock = boto3.client('bedrock-runtime', region_name='us-east-1')

def analyze_image_for_pii(image_bytes):
    response = bedrock.invoke_model(
        modelId='amazon.nova-pro',
        body=json.dumps({
            "messages": [{"role": "user", "content": [
                {"image": {"format": "jpeg", "source": {"bytes": image_bytes}}},
                {"text": "Identify regions containing PII. Return bounding boxes."}
            ]}],
            "inferenceConfig": {"temperature": 0.1}
        })
    )
    return json.loads(response['body'].read())

As coordenadas retornadas pelo Nova alimentam o SAM, que gera máscaras no nível do pixel — muito mais precisas que bounding boxes retangulares. O pipeline então aplica blur ou tarja apenas nas áreas exatas.

Casos de uso reais

  • Compliance hospitalar: anonimizar exames e prontuários antes de compartilhar para pesquisa
  • Call centers: redigir screenshots com documentos enviados por clientes
  • Setor público: publicar documentos oficiais com dados removidos
  • Fintechs: processar onboarding KYC com versões sanitizadas
  • Jornalismo: redigir rostos e documentos antes da publicação

Limitações

  • PII em fontes pequenas, baixa resolução ou ângulos extremos pode escapar
  • Textos manuscritos com caligrafia irregular são desafiadores
  • Custo por imagem varia — para volumes altos, avalie Provisioned Throughput
  • SAM adiciona latência extra; considere processamento assíncrono para lotes

Por que essa combinação importa

Até recentemente, redigir PII em imagens exigia ferramentas especializadas caras ou trabalho manual. A combinação Nova + SAM torna o processo acessível via API, escalável e programático. Para empresas brasileiras lidando com LGPD, é uma alternativa concreta para automatizar uma das tarefas mais tediosas e propensas a erro do compliance digital.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.