A maioria dos agentes de IA tem um problema crônico: eles esquecem. Processam uma requisição, respondem e descartam o contexto. O Google Cloud acaba de lançar no seu repositório generative-ai uma implementação de referência que ataca esse problema de frente: o Always-On Memory Agent, um agente leve que roda 24/7 como processo contínuo usando o Gemini 3.1 Flash-Lite — sem banco vetorial, sem embeddings.
O que é o Always-On Memory Agent?
Diferente de chatbots que processam uma pergunta e descartam o contexto, o Always-On Memory Agent é um processo em segundo plano que nunca para. Construído com o Google ADK (Agent Development Kit) e o Gemini 3.1 Flash-Lite, ele usa o próprio LLM para ler, pensar e escrever memória estruturada em um banco SQLite — sem nenhum banco vetorial ou cálculo de embeddings. A escolha do modelo Flash-Lite mira baixa latência e custo mínimo para trabalho contínuo em segundo plano.
Como funciona: Ingestão, Consolidação, Consulta
A arquitetura é elegante: um orquestrador roteia cada requisição para um de três sub-agentes especializados, cada um com suas próprias ferramentas de leitura e escrita:
- IngestAgent: recebe conteúdo em 27 formatos diferentes (texto, imagens, áudio, vídeo, PDFs) e usa a capacidade multimodal do Gemini para extrair resumo, entidades, tópicos e uma pontuação de importância. O registro estruturado vai para a tabela
memories. - ConsolidateAgent: executa a cada 30 minutos (configurável), como ciclos de sono. Revisa memórias não consolidadas, encontra conexões entre elas e escreve um resumo sintetizado, um insight-chave e as relações descobertas. O agente constrói novo entendimento enquanto está ocioso, sem nenhum prompt.
- QueryAgent: responde perguntas lendo todas as memórias e insights de consolidação. Importante: cita os IDs de memória usados como fontes.
Comparação com as abordagens tradicionais
| Abordagem | Armazenamento | Processamento ativo | Limitação principal |
|---|---|---|---|
| Vector DB + RAG | Embeddings em banco vetorial | Nenhum | Passivo; embute uma vez, recupera depois |
| Resumo de conversa | Texto comprimido | Nenhum | Perde detalhes; sem referência cruzada |
| Knowledge graphs | Nós e arestas | Manutenção manual | Caro para construir e manter |
| Always-On Memory Agent | Linhas estruturadas em SQLite | Consolidação contínua | Query lê até 50 memórias recentes |
A diferença fundamental: ao contrário do RAG, que é passivo (embute uma vez, recupera sob demanda), o Memory Agent processa memória ativamente e continuamente, descobrindo conexões mesmo quando ninguém está perguntando nada.
Formatos suportados e configuração mínima
O IngestAgent aceita 27 tipos de arquivo em cinco categorias — basta soltar o arquivo na pasta ./inbox:
| Categoria | Extensões |
|---|---|
| Texto | .txt, .md, .json, .csv, .log, .xml, .yaml, .yml |
| Imagens | .png, .jpg, .jpeg, .gif, .webp, .bmp, .svg |
| Áudio | .mp3, .wav, .ogg, .flac, .m4a, .aac |
| Vídeo | .mp4, .webm, .mov, .avi, .mkv |
| Documentos |
Para começar, bastam três comandos:
pip install -r requirements.txt
export GOOGLE_API_KEY="sua-chave-api"
python agent.pyO agente inicia vigiando ./inbox, consolida a cada 30 minutos e serve uma API HTTP na porta 8888. Você também pode alimentá-lo via HTTP:
# Ingerir texto
curl -X POST http://localhost:8888/ingest -H "Content-Type: application/json" -d '{"text": "Agentes de IA são o futuro", "source": "artigo"}'
# Perguntar
curl "http://localhost:8888/query?q=o+que+você+sabe"A API expõe endpoints /status, /memories, /consolidate, /delete e /clear. Um dashboard opcional em Streamlit adiciona controles visuais de ingestão, consulta e exclusão.
Casos de uso reais
- Assistente de pesquisa: ingere PDFs, áudio de reuniões e screenshots durante a semana. Depois, sozinho, conecta uma meta de custo a um problema de confiabilidade.
- Base de conhecimento pessoal: absorve notas, artigos e imagens continuamente. A consolidação revela temas que você nunca conectou explicitamente.
- Agente de suporte: armazena tickets passados como memórias estruturadas e responde novas perguntas com referências citadas a casos anteriores.
Por que isso importa
O Always-On Memory Agent representa um paradigma diferente de memória para IA. Em vez de tratar memória como recuperação passiva de embeddings (RAG), ele a trata como um processo cognitivo ativo e contínuo — mais próximo de como o cérebro humano consolida memórias durante o sono. O fato de rodar em SQLite com Gemini Flash-Lite (baixo custo) e ser open source no repositório generative-ai do Google torna a abordagem acessível para desenvolvedores individuais.
Para equipes que já usam RAG com Pinecone, Weaviate ou pgvector, o Memory Agent não é um substituto direto — é um complemento para cenários onde o contexto precisa evoluir entre sessões, não apenas ser recuperado.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



