Inteligência artificial, sem ruído.
Modelos e LLMs2 min

IA transmite imagens para classificação usando menos dados sem perder precisão

Estrutura modular combina Vision Transformer no cliente e no servidor para enviar só os tokens relevantes, atingindo 85,83% de precisão com 1,24 bits por pixel.

IA transmite imagens para classificação usando menos dados sem perder precisão

O gargalo da transmissão

Enviar imagens de um dispositivo leve para um modelo de IA na nuvem normalmente custa muitos dados — ou se envia a imagem comprimida inteira, ou se transmitem os embeddings de todos os tokens. Um novo framework propõe uma terceira via: transmitir apenas os tokens de imagem relevantes para a tarefa de classificação, deixando que um servidor reconstrua o restante com um token substituto.

Arquitetura em três peças

O sistema coordena um Vision Transformer no cliente, um modelo de compressão de imagem aprendido (LIC) e um Vision Transformer maior no servidor. O casamento espacial um-para-um entre os tokens do ViT e os vetores latentes do LIC permite decidir, no cliente, quais latentes importam para a classificação. A relevância é estimada por “atenção rollout” seletiva por camadas — no cliente DeiT-Tiny de 12 camadas, foram usadas as camadas 7 a 12.

Resultados reportados

Nos testes com ImageNet (entradas de 224×224), o framework atingiu 85,83% de precisão enviando 1,24 bits por pixel (bpp). Para a mesma precisão, o WebP precisou de cerca de 1,57 bpp e o BPG de 1,82 bpp. O resultado fica 0,98 ponto percentual abaixo do limite superior sem perdas de 86,81%. O cliente usado foi o DeiT-Tiny (72,2% de precisão isolado) e o servidor, o DeiT-III-Large (86,8%).

Para que serve

O ganho importa em cenários de borda: dispositivos com memória e banda limitadas que dependem de um modelo maior na nuvem. Como os componentes são pré-treinados e usados sem treino ponta a ponta, a estrutura é modular e mais fácil de adotar em arquiteturas existentes. Os números vêm de um estudo controlado, e o desempenho em imagens fora do ImageNet ainda precisa de validação, mas a direção — enviar só o que é relevante — é promissora para a computação de borda.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.