Inteligência artificial, sem ruído.
Modelos e LLMs2 min

NeoMME: o encoder multimodal e multilíngue que dispensa torre de visão separada

Conheça o NeoMME, encoder multimodal e multilíngue da H Company que usa um único Transformer para texto e imagem e reduz o índice em 255 vezes.

NeoMME: o encoder multimodal e multilíngue que dispensa torre de visão separada

Pesquisadores da H Company apresentaram o NeoMME, uma família de encoders multimodais multilíngues em dois tamanhos (260M e 800M parâmetros) que promete resolver um gargalo silencioso da IA: a recuperação de informação em documentos visuais sem depender de uma torre de visão separada e de um modelo de linguagem causal.

Um único Transformer para texto e imagem

Diferente da maioria dos VLMs, o NeoMME não usa um encoder de visão pré-treinado (como o SigLIP) nem um decodificador causal. Um único Transformer bidirecional processa tanto os tokens de texto quanto os patches brutos de imagem (blocos de 32×32 pixels), treinado do zero com uma abordagem de masked discrete-diffusion.

Isso elimina a sobrecarga de parâmetros e computação de carregar um modelo de visão gigante apenas para produzir features que depois serão projetadas no modelo de linguagem. Como texto e imagem usam o mesmo caminho computacional, o modelo suporta pré-treino, fine-tuning e serving mais simples nas duas modalidades.

NeoMME-Retriever: dois heads, um passe

Para demonstrar o backbone, a equipe treinou o NeoMME-Retriever para recuperação de documentos visuais seguindo a metodologia de page-image do ColPali. Em um único forward pass, ele devolve tanto embeddings densos (via mean pooling) quanto embeddings de late-interaction (projeção por token/patch), dando flexibilidade para qualquer caso de uso.

Nos benchmarks ViDoRe v3, o NeoMME-Retriever-260M alcançou 0.523 nDCG@10 — a melhor pontuação entre modelos abaixo de 800M parâmetros — ficando a 0.002 do ColQwen2.5, que é cerca de 14× maior. Em throughput, ele codifica 51 páginas por segundo numa NVIDIA L40S, quase o dobro do ColModernVBERT.

Compressão de 255× no índice

O late-interaction armazena muitos vetores por página, o que encarece o índice. Combinando hierarchical token pooling e asymmetric quantization, a equipe reduziu o armazenamento de cerca de 1,5 MB para apenas 6 kB por página — uma compressão de 255× — mantendo mais de 95% da qualidade de recuperação original.

Disponível agora, sob Apache 2.0

Todos os checkpoints foram liberados com implementação day-zero no Hugging Face Transformers, sob licença Apache 2.0, incluindo suporte a fine-tuning com Sentence Transformers v6. Para quem trabalha com visual RAG (recuperar páginas como imagens e enviar a um VLM), o NeoMME entra como primeiro estágio de um pipeline que preserva tabelas, gráficos e layout — informações que a extração de texto costuma perder.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.