Remover informações pessoais de documentos digitalizados, fotos e capturas de tela é um desafio comum em compliance, saúde, finanças e setor público. A AWS acaba de publicar uma solução que combina Amazon Nova (seu modelo de visão) com o Segment Anything Model (SAM) da Meta para criar um pipeline de redação automática de PII em imagens.
Como funciona o pipeline
- Amazon Nova analisa a imagem: usando raciocínio visual contextual, o modelo identifica regiões com PII — números de documentos, placas de veículos, rostos, assinaturas, códigos de barras
- SAM segmenta as regiões: o modelo da Meta recebe as coordenadas do Nova e gera máscaras precisas sobre as áreas sensíveis
- Redação é aplicada: as regiões mascaradas recebem blur, tarja preta ou pixelização
- Imagem final é salva: versão sanitizada com todos os dados sensíveis removidos
Requisitos
| Componente | Mínimo | Recomendado |
|---|---|---|
| Conta AWS | Free tier | Com acesso ao Bedrock |
| Modelos | Amazon Nova (via Bedrock) | Nova + SAM |
| Permissões | bedrock:InvokeModel | IAM role com S3 e Bedrock |
| Conhecimento | Python básico | Familiaridade com boto3 |
Tipos de PII detectáveis
- Documentos de identidade: RG, CPF, CNH, passaportes
- Placas de veículos: reconhecimento de padrões Mercosul e anteriores
- Rostos: detecção facial com blur seletivo
- Assinaturas: identificação de campos de assinatura
- Cartões: números de crédito visíveis em fotos
Passo a passo simplificado
import boto3, json
bedrock = boto3.client('bedrock-runtime', region_name='us-east-1')
def analyze_image_for_pii(image_bytes):
response = bedrock.invoke_model(
modelId='amazon.nova-pro',
body=json.dumps({
"messages": [{"role": "user", "content": [
{"image": {"format": "jpeg", "source": {"bytes": image_bytes}}},
{"text": "Identify regions containing PII. Return bounding boxes."}
]}],
"inferenceConfig": {"temperature": 0.1}
})
)
return json.loads(response['body'].read())As coordenadas retornadas pelo Nova alimentam o SAM, que gera máscaras no nível do pixel — muito mais precisas que bounding boxes retangulares. O pipeline então aplica blur ou tarja apenas nas áreas exatas.
Casos de uso reais
- Compliance hospitalar: anonimizar exames e prontuários antes de compartilhar para pesquisa
- Call centers: redigir screenshots com documentos enviados por clientes
- Setor público: publicar documentos oficiais com dados removidos
- Fintechs: processar onboarding KYC com versões sanitizadas
- Jornalismo: redigir rostos e documentos antes da publicação
Limitações
- PII em fontes pequenas, baixa resolução ou ângulos extremos pode escapar
- Textos manuscritos com caligrafia irregular são desafiadores
- Custo por imagem varia — para volumes altos, avalie Provisioned Throughput
- SAM adiciona latência extra; considere processamento assíncrono para lotes
Por que essa combinação importa
Até recentemente, redigir PII em imagens exigia ferramentas especializadas caras ou trabalho manual. A combinação Nova + SAM torna o processo acessível via API, escalável e programático. Para empresas brasileiras lidando com LGPD, é uma alternativa concreta para automatizar uma das tarefas mais tediosas e propensas a erro do compliance digital.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



