Os seis critérios para escolher uma IA

Uma caixa de ferramentas aberta, com espacos para ferramentas diferentes.

Raciocínio contra velocidade, custo por volume, tamanho do espaço de contexto, se lida com imagem e áudio, se executa ferramenta, e o que pode ou não sair da sua máquina. Esses seis respondem quase toda escolha, e nenhum deles envelhece. O que envelhece é a resposta que eles dão em cada momento, e é por isso que ranking dura semanas e critério dura anos.

A pergunta “qual é a melhor IA” não tem resposta pelo mesmo motivo que “qual é a melhor chave de fenda” não tem. Ninguém pergunta isso: pergunta qual é o parafuso que está na mão. Com IA é igual, e a tarefa é o parafuso. Trocar a pergunta é a única coisa que sobrevive à próxima atualização de todo mundo.

O vídeo fecha o curso trocando a pergunta. Este texto abre cada critério e o protocolo do teste.

Leve o mapa mental desta aula com você

O vídeo tem um apoio visual desenhado à mão, o mesmo que aparece na abertura e no fecho da aula. Está disponível pra download em Excalidraw, e abre arrastando o arquivo pra dentro do excalidraw.com, de graça, sem instalar nada.

O contexto, em três linhas

Sou engenheiro de software sênior e passei os últimos anos colocando modelos de linguagem em produção, em sistema que outras pessoas usam.

A escolha de qual IA usar costuma ser decidida por manchete, e manchete é a pior fonte possível para isso. Um critério escrito uma vez sobrevive a todas as manchetes seguintes.

Por que ranking envelhece e critério não

Uma caixa de ferramentas aberta, com espacos para ferramentas diferentes.
Ninguém pergunta qual é a melhor chave de fenda. Pergunta qual é o parafuso.

Ranking mede um conjunto de tarefas que não é o seu, num momento que já passou, com pesos que alguém escolheu sem te consultar. Ele responde uma pergunta média. Você não tem um problema médio: tem uma tarefa específica, com uma restrição específica.

Critério funciona ao contrário. Ele não diz qual ganha; diz o que você está comprando quando escolhe uma. E como o que se compra não muda de natureza a cada lançamento, o critério continua valendo depois que o pódio inteiro trocou de nome.

Os seis, e o que cada um decide

Seis compartimentos identificados numa caixa de ferramentas.
Seis compartimentos. Na maior parte dos casos, um deles domina e decide sozinho.
  1. Raciocínio contra velocidade. Decide se você paga por etapas internas antes da resposta. Domina quando a tarefa tem passos que dependem uns dos outros, e é irrelevante quando você valida o resultado batendo o olho. É o assunto de quando vale esperar a IA pensar.
  2. Custo por volume. Decide quando a tarefa se repete muito. Uma diferença pequena por chamada vira a maior linha do orçamento em escala, e vira ruído em uso ocasional. A unidade dessa conta é a mesma do espaço onde a conversa cabe.
  3. Tamanho do contexto. Decide quanto material sobe de uma vez. Domina quando você trabalha com documento longo, e vale lembrar que espaço grande e cheio de coisa irrelevante rende menos que espaço pequeno e limpo.
  4. Imagem e áudio. Decide se você pode mostrar em vez de descrever. Domina em qualquer fluxo com print, foto, gravação ou documento escaneado. É o assunto de como a IA entende uma imagem.
  5. Execução e ferramenta. Decide se ela responde ou se ela faz. Domina quando a saída esperada é uma mudança no mundo, e traz junto a conversa sobre aprovação, que está em a diferença entre agente e chatbot.
  6. Privacidade do dado. Decide o que pode sair da sua máquina, e por isso costuma eliminar opções antes de qualquer comparação de qualidade. É o critério de o que você nunca deve colar numa IA.

O sexto é o que quase ninguém coloca na conta, e é o que mais decide em empresa. Ele não pondera com os outros: ele corta. Uma opção excelente que não pode receber aquele dado simplesmente não está na disputa.

Os seis não envelhecem. O que envelhece é a resposta que eles dão hoje.

O teste de dez minutos

A mesma tarefa entrando em dois caminhos diferentes para comparacao.
Mesma entrada, mesmo critério de sucesso, nos dois lados. É isso que torna a comparação válida.

Dez minutos com a sua tarefa resolvem mais que dez artigos sobre a tarefa dos outros. O protocolo é curto, e a disciplina toda está em manter tudo igual menos a variável que você está testando.

  1. Escolha uma tarefa real e chata, daquelas que você faz toda semana. Tarefa exemplar mede vaidade; tarefa real mede utilidade.
  2. Escreva o critério de sucesso antes de rodar. Duas ou três condições verificáveis. Sem isso, você vai julgar pelo texto mais bonito, que é exatamente o viés que este curso inteiro tenta corrigir.
  3. Rode a mesma entrada nos dois, sem ajustar nada no meio. Ajustar o pedido para um dos lados invalida a comparação, e é o erro mais comum.
  4. Compare contra o critério, não entre si. A pergunta não é qual ficou melhor, é qual atendeu o que você escreveu antes de olhar.

O resultado vale para o seu caso, que é o único que importa. E ele continua valendo depois, porque você guardou a tarefa e o critério: quando aparecer uma opção nova, o teste já está pronto para rodar de novo.

Onde tudo isso fica registrado

Escrevo tudo o que aprendo aqui neste blog, que roda num plano de quatro anos da Hostinger, que eu recomendo.

O vídeo lá em cima é a última aula de um curso gratuito de fundamentos de inteligência artificial, com aulas curtas e um conceito por vez. Ele percorre como ela gera, como você conduz, quando ela age e como você julga. Os seis critérios deste texto são o que sobra quando você já entendeu os quatro.

O que eu faria diferente se começasse hoje

Eu escreveria o critério de sucesso antes de testar qualquer coisa. Eu guardaria uma tarefa real como régua permanente. E eu pararia de tratar lançamento como notícia que exige ação.

No fundo é a diferença entre escolher tecnologia por benchmark e escolher por requisito. Já vimos isso com banco de dados, com linguagem e com framework: a comparação genérica é interessante de ler e péssima de decidir. O que decide é a sua carga, o seu time e a sua restrição.


A newsletter sai todo domingo, com o bastidor do que eu estou construindo, incluindo o que não deu certo.

Receba as análises da semana

Um e-mail por semana com o que foi publicado e analisado.

Gabriel Carvalho

Quem escreve

Gabriel Carvalho

Engenheiro fullstack sênior e especialista em IA. Liderou avaliação de LLMs, sistemas RAG e agentes autônomos em uma das maiores plataformas de IA da América Latina.

LinkedIn · Instagram