Inteligência artificial, sem ruído.
Google AI7 min

Google lança Guided Vision no Gemini Live para assistência visual em tempo real

Guided Vision chega ao Gemini Live no Android com descrições por câmera e orientação verbal; Google alerta que não substitui auxílio de mobilidade.

Google lança Guided Vision no Gemini Live para assistência visual em tempo real

O Google lançou em 1º de outubro de 2026 o Guided Vision, um modo do Gemini Live para Android que usa a câmera e voz para descrever o ambiente e orientar o enquadramento em tempo real. O recurso foi desenvolvido com pessoas cegas e com baixa visão, funciona em aparelhos com Android 9 ou superior onde o Gemini Live é compatível e deixa explícito um limite decisivo: não é dispositivo médico, auxílio de mobilidade nem substituto para bengala ou orientação segura de deslocamento.

A novidade importa porque muda o papel da câmera no assistente: em vez de apenas responder à imagem já capturada, o Gemini Live pode pedir que a pessoa aproxime, afaste, incline ou mova o telefone para obter contexto visual suficiente. Para tarefas como ler um rótulo, localizar um objeto ou conferir detalhes de uma roupa, essa orientação pode reduzir uma barreira prática que permanece mesmo em recursos de visão computacional bem estabelecidos.

O que o Guided Vision faz no Gemini Live

Guided Vision é uma camada de assistência visual conversacional dentro do Gemini Live. Com o compartilhamento de câmera ativado, o sistema descreve objetos e texto visíveis, aceita perguntas de acompanhamento e fornece instruções verbais para corrigir um enquadramento ruim. Na prática, em vez de receber uma resposta genérica para uma imagem desfocada ou parcial, a pessoa pode ouvir uma orientação como mover a câmera para a direita, inclinar para baixo ou afastar o aparelho.

O Google cita como cenários previstos a leitura de letras pequenas em embalagens, mostradores de eletrodomésticos e cardápios; a busca por itens em uma mesa ou armário; a identificação de cores, padrões e formas; e a descrição de espaços e objetos próximos. Esses exemplos não significam que o sistema reconheça tudo corretamente em qualquer iluminação ou ângulo: eles delimitam tarefas de verificação visual pontual, não navegação autônoma.

Vídeo demonstrativo publicado pelo Google sobre o Guided Vision.

Como o recurso difere de uma descrição comum de imagem

Uma descrição de imagem tradicional começa depois que a foto existe. O Guided Vision acrescenta uma etapa anterior: ajudar a produzir uma entrada visual utilizável. Isso é relevante porque a qualidade da resposta de um modelo multimodal depende do que a câmera realmente mostra. Um rótulo fora de foco, um produto cortado ou uma cena em contraluz podem levar a uma resposta incompleta; o feedback de reenquadramento tenta reduzir esse problema antes da interpretação.

O fluxo também é conversacional. A pessoa pode começar com uma descrição ampla do que está diante dela e, em seguida, perguntar sobre uma parte específica. O Google diz que o modo foi testado para que as descrições, os comandos de reenquadramento e as respostas soem naturais em vários idiomas, após testes com comunidades de baixa visão em países que incluem o Brasil, Índia, Singapura, Indonésia e Japão. A empresa não informou, no anúncio, uma lista separada de disponibilidade por país; portanto, usuários brasileiros devem confirmar a compatibilidade do Gemini Live e da conta antes de depender do recurso.

Treinamento, teste e salvaguardas declaradas pelo Google

Segundo o comunicado oficial, o Google trabalhou com a Aira para interpretação visual de dados em um total de dezenas de milhares de horas. Mais de mil pessoas da rede Trusted Tester da Aira participaram de testes e refinamentos, e especialistas da organização contribuíram para estabelecer e avaliar salvaguardas. A empresa não divulgou metodologia de avaliação, métricas de acurácia, taxa de erro por tarefa ou desempenho em português brasileiro; esses dados seriam necessários para comparar o recurso de forma independente com alternativas de acessibilidade.

O ponto mais importante do anúncio é a limitação de segurança. O próprio Google afirma que o Guided Vision pode errar e não deve ser usado como dispositivo médico, ajuda de mobilidade, substituto de bengala branca, orientação para deslocamento seguro ou detector de obstáculos. Trata-se de uma restrição operacional, não de um detalhe jurídico: uma descrição incorreta de degrau, trânsito, distância ou direção pode gerar risco físico. O uso apropriado é assistência em ambiente imediato e tarefas de baixa consequência, com os recursos tradicionais de mobilidade mantidos para deslocamento.

Como ativar no Android

O acesso depende de um dispositivo compatível, Android 9 ou posterior e de uma região e idioma em que o Gemini Live esteja disponível. O Google descreve três caminhos:

  • Aplicativo Gemini: nas configurações do perfil, ative “Use Guided Vision in Live”; depois abra o Gemini Live e compartilhe a câmera.
  • Atalho de acessibilidade: em Configurações > Acessibilidade > Assistência visual > Guided Vision, configure o botão flutuante, o gesto de dois dedos ou o pressionamento simultâneo das teclas de volume.
  • Integração com TalkBack: quem usa o leitor de tela pode abrir o menu do TalkBack com toque de três dedos e selecionar Guided Vision.

Antes de usar, vale atualizar o aplicativo Gemini e o sistema Android. Se a opção não aparecer, isso não prova uma falha no telefone: pode significar que a distribuição ainda não alcançou a conta, o idioma ou a região do usuário.

Impacto prático e limites para usuários no Brasil

Para pessoas cegas ou com baixa visão, a combinação de câmera, diálogo e atalho de acessibilidade pode encurtar tarefas em que a informação visual muda rapidamente: distinguir uma embalagem, confirmar uma etiqueta ou procurar um item caído. Também pode ser útil para idosos, pessoas com baixa alfabetização ou qualquer usuário que precise ler informação pequena em pouca luz, casos mencionados pelo Google.

Mas a utilidade real dependerá de conectividade, qualidade da câmera, ruído ambiental, idioma, privacidade do local e consistência do modelo. O anúncio não estabelece que o Guided Vision seja disponível em todo o Brasil nem fornece garantias para leitura de dados sensíveis, como medicamentos, valores financeiros ou instruções de segurança. Nessas situações, a saída do modelo deve ser conferida por outra fonte acessível e confiável.

Análise do NoticIA: a diferença está na orientação, não só na visão

Na análise do NoticIA, o avanço mais concreto não é apenas adicionar descrição de imagens ao Gemini. Produtos multimodais já fazem isso há algum tempo. A mudança é tratar o enquadramento como parte da interação: o modelo tenta ajudar a pessoa a construir uma entrada melhor sem exigir que ela veja a tela para perceber o problema. Esse desenho responde a uma fricção específica de interfaces visuais e dá ao recurso uma proposta mais clara do que “IA que enxerga”.

A contrapartida é que orientação verbal persuasiva não equivale a confiabilidade em ambientes físicos. A própria limitação declarada pelo Google é adequada e deve orientar a adoção: Guided Vision pode complementar autonomia em tarefas domésticas e informacionais, mas não deve deslocar ferramentas de mobilidade, critérios de segurança ou supervisão humana quando o erro tem consequência alta. A próxima métrica que falta ao debate é pública: avaliações independentes por idioma, cenário, iluminação e tipo de tarefa.

Pontos principais

  • Guided Vision chega ao Gemini Live em 1º de outubro de 2026 para Android compatível.
  • O modo descreve o que a câmera vê e fornece instruções verbais para melhorar o enquadramento.
  • O Google cita testes com mais de mil participantes da rede Aira e comunidades de vários países, incluindo o Brasil.
  • O recurso exige Android 9 ou superior e disponibilidade local do Gemini Live.
  • Não é apropriado para navegação, detecção de obstáculos ou substituição de auxiliares de mobilidade.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.