A extração automatizada de dados de e-mails é um desafio comum para empresas que processam milhões de mensagens diariamente. Modelos de linguagem de grande porte (LLMs) podem alucinar, confundir campos semelhantes (como número do pedido e número de rastreio) e gerar custos elevados com tokens, especialmente em e-mails em HTML. Para resolver esses problemas, a AWS anunciou a possibilidade de fazer fine-tuning dos modelos Amazon Nova (Nova Micro e Nova Lite) usando o Amazon SageMaker AI, combinando técnicas de Parameter-Efficient Fine-Tuning (PEFT) com Low-Rank Adaptation (LoRA).
O case de referência é a Parcel Perform, plataforma de experiência de entrega para e-commerce, que colaborou com o AWS Generative AI Innovation Center (GenAIIC). Após o fine-tuning, o modelo Nova Micro alcançou 94,77% de precisão na extração de entidades — um ganho de até 16,6 pontos percentuais sobre o modelo base —, reduziu a latência de inferência em mais de 30% e cortou os custos pela metade em relação ao modelo anterior. A solução já está em produção.
O que foi lançado
Não se trata de um novo serviço, mas da disponibilização de um fluxo completo de fine-tuning supervisionado (SFT) com PEFT/LoRA para os modelos Amazon Nova Lite e Amazon Nova Micro, utilizando o Amazon SageMaker AI para o treinamento e o Amazon Bedrock para implantação com inferência sob demanda (pay-per-token). Os modelos ajustados podem ser implantados diretamente no Bedrock, sem necessidade de gerenciar infraestrutura dedicada.
Para quem serve
A solução é voltada para equipes de engenharia e dados que precisam extrair campos estruturados (como número de pedido, status, transportadora, data) de e-mails de e-commerce ou qualquer outro domínio com formatos variados. É especialmente útil para quem já enfrenta alucinações ou confusão entre campos similares em LLMs genéricos.
Disponibilidade e preço
O fine-tuning via SageMaker AI está disponível nas regiões onde Amazon Nova é suportado. O treinamento usa instâncias GPU (g5/g6 ou p5) e o custo é baseado no tempo de computação. A implantação no Bedrock com inferência sob demanda é cobrada por token processado. Não há custo adicional de licenciamento para o fine-tuning em si, apenas pelos recursos consumidos.
Como acessar
Para começar, é necessário:
- Uma conta AWS com permissões adequadas.
- Acesso ao Amazon Bedrock e aos modelos Nova na região escolhida.
- Uma IAM role com permissões para customização de modelos no Bedrock.
- Um bucket S3 para armazenar dados de treinamento e artefatos.
- Dados de treinamento no formato JSONL, seguindo o schema de conversação do Bedrock.
- Cotas de serviço suficientes para o tipo de instância no SageMaker Training.
O fluxo básico é:
- Preparar dados de treinamento no formato de conversa do Bedrock, com o e-mail como entrada do usuário e as entidades extraídas como resposta do assistente.
- Fazer upload dos dados para um bucket S3.
- Criar um job de fine-tuning no SageMaker AI usando configuração LoRA. Parâmetros sugeridos:
peft_scheme: lora,loraplus_lr_ratio: 8.0,alpha: 32,max_epochs: 2,global_batch_size: 64. - Importar o modelo ajustado para o Amazon Bedrock como um modelo customizado.
- Executar inferência via API Bedrock Runtime, pagando por token.
Exemplo de chamada de inferência (Python com boto3):
import boto3
import json
bedrock_runtime = boto3.client(service_name="bedrock-runtime")
def extract_entities(email_content, model_arn):
body = {
"messages": [{
"role": "user",
"content": f"Extract all relevant data fields from this email:\n\n{email_content}"
}],
"max_tokens": 2048,
"temperature": 0.1
}
response = bedrock_runtime.invoke_model(
body=json.dumps(body),
modelId=model_arn,
accept="application/json",
contentType="application/json"
)
response_body = json.loads(response['body'].read())
return response_body['output']['message']['content'][0]['text']
email = """Dear Customer, Your order has been shipped! Carrier: FedEx Estimated Delivery: January 15, 2025"""
result = extract_entities(email, "arn:aws:bedrock:us-east-1:${account-id}:provisioned-model/your-model-id")
print(result)
Impacto prático
O fine-tuning com PEFT/LoRA permite que modelos menores (Nova Micro) superem modelos maiores em tarefas específicas, com menos alucinações e maior precisão. A redução de latência em ~32% e de custos em ~50% torna viável a automação em larga escala. Além disso, a implantação com preço por token elimina a necessidade de provisionar instâncias dedicadas.
Segundo a AWS, com apenas 1.300 amostras de treinamento (para 25 entidades) já é possível obter ganhos significativos. O aumento para 4.900 amostras trouxe melhoria adicional de até 3,3 pontos percentuais.
Links úteis
- Criar um modelo customizado no Bedrock
- Customizar modelos no Amazon Bedrock
- Inferência sob demanda para modelos customizados
- Criar IAM role para customização
- Provisioned Throughput no Bedrock
- Amazon Nova recipes
- Treinamento iterativo com Nova
- Amazon Nova Customization Hub (GitHub)
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



