Inteligência artificial, sem ruído.
Modelos e LLMs4 min

ConTextual: Novo benchmark para raciocínio multimodal em imagens com textos complexos

O que é o ConTextual? ConTextual é um novo conjunto de dados e benchmark criado por pesquisadores da Universidade da Califórnia em Los Angeles (UCLA)…

O que é o ConTextual?

ConTextual é um novo conjunto de dados e benchmark criado por pesquisadores da Universidade da Califórnia em Los Angeles (UCLA) para avaliar a capacidade de modelos multimodais (LMMs) de realizar raciocínio conjunto sobre textos e imagens em cenas ricas em texto. Diferentemente dos testes tradicionais que avaliam modelos apenas na compreensão de imagens ou textos isoladamente, o ConTextual foca em cenários onde a interação entre texto e contexto visual é fundamental, como mapas, memes, infográficos e interfaces digitais.

Características do dataset e das tarefas

O ConTextual contém 506 instruções desafiadoras distribuídas em oito categorias do mundo real: Leitura de horários, Compras, Navegação, Cenas abstratas, Aplicativos móveis, Páginas web, Infográficos e Cenas naturais diversas. Cada exemplo inclui:

Imagem relacionada ao artigo de HuggingFace
Imagem de apoio da materia original.
  • Uma imagem rica em texto;
  • Uma instrução humana (pergunta ou tarefa imperativa);
  • Uma resposta de referência escrita por humanos.

O dataset é disponibilizado em duas versões: um conjunto de validação com 100 exemplos completos (imagens, instruções e respostas) e um conjunto de teste com 506 exemplos contendo apenas imagens e instruções. Para facilitar o desenvolvimento, há um sandbox de avaliação disponível no GitHub.

Modelos avaliados e metodologia

Na avaliação inicial, 13 modelos foram testados, divididos em três grupos:

  • Abordagem LLM aumentada: GPT-4 combinado com informações visuais extraídas via OCR e legendas densas das imagens;
  • Modelos fechados: GPT-4V(ision) e Gemini-Vision-Pro;
  • Modelos open-source: LLaVA-v1.5-13B, ShareGPT4V-7B, Instruct-Blip-Vicuna-7B, mPlugOwl-v2-7B, Bliva-Vicuna-7B, Qwen-VL-7B e Idefics-9B.

A avaliação automática utiliza um método de “LLM como juiz”, onde o GPT-4 recebe a instrução, a resposta de referência e a resposta prevista pelo modelo para decidir se esta é aceitável, aproveitando sua alta correlação com avaliações humanas.

Principais resultados e desafios identificados

Os testes mostraram que os modelos multimodais atuais ainda enfrentam dificuldades significativas para lidar com o raciocínio conjunto em imagens com textos complexos. Entre os pontos destacados:

  • Modelos proprietários, mesmo os de ponta, têm desempenho inferior ao humano em tarefas que envolvem leitura de horários e interpretação de infográficos;
  • GPT-4V foi o melhor modelo, superando humanos em raciocínio abstrato, possivelmente devido ao treinamento com memes e citações, mas apresentou fragilidades em tarefas temporais;
  • Modelos open-source apresentaram bom desempenho apenas em domínios como cenas abstratas e naturais, mas ficaram atrás em áreas como navegação, compras e uso de aplicativos, sugerindo falta de diversidade nos dados de treinamento;
  • A abordagem que combina LLMs com OCR e legendas textuais teve aprovação humana baixa (17,2%), indicando que é necessário um alinhamento mais fino entre visão e linguagem para resolver esses desafios.

Os pesquisadores recomendam avanços em codificadores de imagem, descrições visuais precisas e alinhamento detalhado entre visão e linguagem para melhorar o desempenho em raciocínio multimodal contextualizado.

Imagem relacionada ao artigo de HuggingFace
Imagem de apoio da materia original.

Como participar do benchmark ConTextual

O ConTextual está aberto para submissões de resultados dos modelos tanto no conjunto de validação quanto no conjunto de teste. Para o conjunto de validação, há um código de autoavaliação baseado no GPT-4 disponível no repositório oficial (https://github.com/rohan598/ConTextual), que gera um arquivo JSON com os resultados esperados.

Formato esperado para submissão na validação:

{
  "nome_do_modelo": {
    "url_da_imagem": 1 // para sucesso, 0 para falha
  }
}

São esperadas 100 previsões, uma para cada URL do conjunto de validação.

Para submissão no conjunto de teste, o arquivo JSON deve conter as 506 previsões de respostas em texto para cada imagem e instrução, e deve ser enviado diretamente aos responsáveis (Rohan e Hritik) via e-mail, incluindo informações como nome do modelo, afiliação e, opcionalmente, link para repositório ou artigo.

Exemplos do benchmark

O blog oficial apresenta exemplos ilustrativos onde modelos como GPT-4V acertam ou erram em tarefas específicas, destacando a complexidade do raciocínio necessário. Por exemplo, em alguns casos GPT-4V falhou apesar de raciocínio lógico aparente, enquanto modelos open-source enfrentaram dificuldades em interpretar corretamente a interação entre texto e imagem.

Links úteis

Frequently Asked Questions

Qual a principal diferença entre o ConTextual e outros benchmarks de raciocínio multimodal?

O ConTextual foca especificamente na interação complexa entre texto e imagem em cenários do mundo real, como mapas e infográficos. Diferente de testes que avaliam compreensão isolada de texto ou imagem, ele exige raciocínio conjunto onde o texto é parte integrante do contexto visual para a resolução da tarefa.

Em quais tipos de tarefas os modelos multimodais atuais mais falham segundo o benchmark ConTextual?

Os modelos atuais demonstram dificuldades significativas em tarefas que exigem leitura de horários e interpretação detalhada de infográficos. Isso sugere que a compreensão contextual e a extração precisa de informações específicas em layouts complexos ainda são desafios.

Por que o GPT-4V teve bom desempenho em raciocínio abstrato, mas fragilidades em tarefas temporais?

A hipótese para o bom desempenho em raciocínio abstrato é o treinamento do GPT-4V com dados como memes e citações, que exigem interpretação de nuances. As fragilidades em tarefas temporais, como leitura de horários, indicam que a precisão temporal em contextos visuais ainda necessita de aprimoramento.

Qual a limitação observada nos modelos open-source no benchmark ConTextual?

Os modelos open-source se destacaram em domínios mais gerais como cenas abstratas e naturais. No entanto, apresentaram desempenho inferior em tarefas mais específicas como navegação, compras e uso de aplicativos, o que pode indicar uma falta de diversidade ou profundidade em seus dados de treinamento para esses cenários.

Como os pesquisadores planejam melhorar o desempenho dos modelos em raciocínio multimodal contextualizado?

As recomendações incluem o avanço em codificadores de imagem para melhor extração visual, a geração de descrições visuais mais precisas e, crucialmente, um alinhamento mais detalhado entre a compreensão visual e a capacidade de linguagem dos modelos para que processem informações de forma integrada.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.