Como a IA entende uma imagem que você manda

Um print de tela sendo colocado dentro de uma janela de conversa.

Ela não lê a sua imagem do jeito que você lê. A imagem é cortada numa grade de pedacinhos, cada pedacinho vira uma unidade do mesmo tipo que uma sílaba de texto vira, e a partir daí a IA faz o que sempre faz: prever o próximo pedaço. Não existe um módulo de visão separado que descreve a foto e passa o texto adiante. É o mesmo mecanismo, com outra entrada.

Isso tem uma consequência prática que quase ninguém tira: a qualidade da resposta sobre uma imagem depende muito menos da sua pergunta e muito mais do que a imagem entrega. Print cortado, com pouco contraste, ou que mostra o sintoma sem mostrar o contexto rende resposta pior pelo mesmo motivo que um texto ambíguo rende. Falta informação, e falta de informação nunca faz ela parar.

O vídeo mostra por que imagem, áudio e texto acabam virando a mesma coisa. Este texto pega o lado prático disso.

Leve o mapa mental desta aula com você

O vídeo tem um apoio visual desenhado à mão, o mesmo que aparece na abertura e no fecho da aula. Está disponível pra download em Excalidraw, e abre arrastando o arquivo pra dentro do excalidraw.com, de graça, sem instalar nada.

O contexto, em três linhas

Sou engenheiro de software sênior e passei os últimos anos colocando modelos de linguagem em produção, em sistema que outras pessoas usam.

Mandar print pra IA virou hábito antes de virar assunto. A maior parte das pessoas faz isso todo dia e nunca parou pra perguntar o que acontece do outro lado. Vale parar, porque a resposta muda o jeito de tirar o print.

Ela não abre a imagem, ela quebra a imagem

Um print de tela sendo colocado dentro de uma janela de conversa.
Você cola o print e pergunta. Do outro lado, a imagem deixa de ser imagem antes de qualquer coisa acontecer.

O primeiro passo não é olhar. É cortar. A imagem é dividida numa grade de blocos pequenos, e cada bloco é convertido numa representação numérica, do mesmo tipo que um pedaço de palavra vira quando você digita. Depois disso, para o modelo, não existe mais diferença de natureza entre o que veio de uma foto e o que veio do seu texto. Tudo virou a mesma unidade.

É por isso que ela consegue responder sobre a imagem com palavras, e é por isso que ela consegue relacionar o que está na imagem com o que você escreveu na mesma mensagem. Os dois estão no mesmo formato, na mesma pilha, disponíveis ao mesmo tempo.

Reconhecer não é o mesmo que ler. Quando ela devolve o texto de um documento fotografado, o resultado se parece com o de um leitor de caracteres, mas o caminho é outro: ela está prevendo o texto mais provável dado aquele conjunto de blocos. Na maior parte das vezes isso coincide com o que está escrito. Quando a letra é ruim, o ângulo é torto ou o termo é incomum, o mais provável e o que está lá deixam de ser a mesma coisa.

Imagem também custa ficha

Uma letra, uma imagem e uma onda sonora virando fichas iguais.
Letra, pedaço de imagem e trecho de som chegam como a mesma unidade. E a unidade é a mesma que você paga.

Se cada bloco da grade vira uma unidade, uma imagem grande vira muitas unidades. E essas unidades disputam o mesmo espaço que o texto disputa, além de entrarem na conta do mesmo jeito. Duas consequências caem daí, e as duas são práticas.

A primeira: mandar oito prints de uma vez enche o espaço rápido, e o que estava no começo da conversa começa a cair antes do que você imagina. A segunda: resolução altíssima raramente compensa. O que decide não é o número de pixels, é se o detalhe que importa está legível depois do corte em blocos. Um recorte apertado no trecho certo costuma render mais que a tela inteira em alta resolução.

Não mande a tela. Mande o pedaço da tela que decide a resposta.

O que faz um print render, e o que faz ele render mal

Depois de entender que ela prevê a partir de blocos, os acertos e os erros param de parecer aleatórios. O que ajuda e o que atrapalha vira uma lista curta.

  • Contraste alto ajuda mais que resolução alta. Texto claro sobre fundo claro some no corte em blocos, mesmo com muitos pixels.
  • O erro e a causa precisam estar no mesmo enquadramento. A mensagem de erro sozinha, sem o comando que a gerou, é uma pergunta ambígua, e ambiguidade ela preenche.
  • Recorte vence tela cheia. Menos blocos irrelevantes é menos coisa competindo pela atenção dela, além de ser mais barato.
  • Foto de tela com o celular perde para o print. Reflexo, moiré e ângulo criam blocos que não existem no original, e cada um deles é ruído entrando como se fosse informação.

Nada disso é folclore de quem usa muito. É consequência direta do corte em grade: tudo que degrada o bloco degrada a previsão feita a partir dele.

Quando mostrar ganha de descrever

Um paragrafo longo de um lado e um print pequeno do outro, com destaque no print.
Descrever leva um parágrafo e ainda perde detalhe. Mostrar leva um print.

A regra que eu uso é simples: toda vez que descrever der trabalho, mostre. Layout quebrado, gráfico estranho, erro com stack trace, planilha com formatação esquisita, quadro branco no fim de uma reunião. Em todos esses casos o parágrafo que você escreveria seria mais longo, mais lento e menos completo que a imagem.

O inverso também vale, e é onde muita gente erra: quando a informação que decide a resposta é uma regra, uma restrição ou uma preferência sua, imagem não ajuda em nada. Isso não está em tela nenhuma. Isso só existe se você escrever.

Ver não é entender

O limite honesto é este, e ele é o mesmo limite de sempre. Se o print estiver ruim, cortado ou ambíguo, ela completa o que faltou, e completa com a mesma cara de certeza que teria se tivesse visto tudo. Não existe um aviso de imagem insuficiente.

Então a conferência continua igual. Se a resposta depende de um número que estava na imagem, confira o número. Se depende de um trecho de código que apareceu na foto, confira o trecho. A entrada mudou de tipo; o mecanismo, não.

Onde tudo isso fica registrado

Escrevo tudo o que aprendo aqui neste blog, que roda num plano de quatro anos da Hostinger, que eu recomendo.

O vídeo lá em cima é a aula sobre multimodal de um curso gratuito de fundamentos de inteligência artificial, com aulas curtas e um conceito por vez. O que este texto detalha sobre imagem sai do mesmo lugar: uma vez que tudo vira a mesma unidade, o comportamento passa a ser previsível, inclusive nos erros.

O que eu faria diferente se começasse hoje

Eu pararia de escrever parágrafos descrevendo tela. Eu recortaria o print no trecho que decide, em vez de mandar a janela inteira. E eu trataria imagem como contexto que ocupa espaço, não como anexo de graça.

No fundo é a mesma disciplina de sempre em engenharia: reduzir o caso ao mínimo que reproduz o problema. Quem já abriu um bug com print da tela cheia e recebeu uma pergunta de volta sabe exatamente do que eu estou falando. A IA reage igual, e pelo mesmo motivo.


A newsletter sai todo domingo, com o bastidor do que eu estou construindo, incluindo o que não deu certo.

Receba as análises da semana

Um e-mail por semana com o que foi publicado e analisado.

Gabriel Carvalho

Quem escreve

Gabriel Carvalho

Engenheiro fullstack sênior e especialista em IA. Liderou avaliação de LLMs, sistemas RAG e agentes autônomos em uma das maiores plataformas de IA da América Latina.

LinkedIn · Instagram