Por que as imagens de IA ainda parecem falsas
Por Chatday Editorial Team ·
Você está há três segundos olhando a foto de um chef montando o prato do jantar quando repara na mão. O polegar dobra para o lado errado e há um quinto dedo onde deveria haver um quarto. Todo o resto é lindo. O vapor, a luz, aquelas marcas douradas no prato. Mas aquela mão entrega tudo, e agora você não consegue mais deixar de ver.
As ferramentas de imagem com IA avançaram muito. Uma geração atrás, elas borravam os rostos e transformavam os dentes em teclas de piano. Agora conseguem criar um retrato que engana quase qualquer um. Quase. Ainda existe um pequeno conjunto de lugares onde a ilusão se quebra, e assim que você sabe onde olhar, passa a vê-los em todo canto.
Então é isto que acontece de verdade: por que uma ferramenta que pinta a pele e o cabelo lindamente ainda escorrega numa mão ou numa placa de rua, e o que isso diz sobre a forma como essas ferramentas ‘enxergam’.
Os sinais que ainda funcionam
Algumas das velhas pistas morreram. A pele plástica, retocada, e aqueles brilhos idênticos nos dois olhos antes gritavam ‘falso’. Os modelos novos já lidam bem com a textura da pele e o reflexo dos olhos, então sozinhos eles não servem mais.
O que ainda escapa? Um punhado de pontos onde o modelo precisa manter muitas coisinhas coerentes ao mesmo tempo.
| Onde olhar | O que entrega | Por que acontece |
|---|---|---|
| Mãos em ação | Dedos a mais ou fundidos ao agarrar, sobrepor ou segurar algo | A pose é complexa e os detalhes são minúsculos, então são resolvidos por último e pior |
| Texto de fundo | Letras derretidas numa placa distante, na lombada de um livro ou num rótulo | O modelo gasta o esforço no sujeito, não nas letras miúdas |
| Reflexos e sombras | Um espelho mostrando outra coisa, sombras que não apontam para lugar nenhum | Ele pinta um reflexo que parece plausível, não um fisicamente correto |
| Padrões repetidos | Fileiras de tijolos que se curvam, azulejos que mudam de tamanho ao longo da imagem | Manter uma grade matematicamente uniforme na imagem inteira é difícil |
| Joias e bordas | Um relógio que se funde pela metade ao pulso, um anel que se mistura à pele | Duas superfícies se tocando de forma limpa é justo o limite em que ele tem dificuldade |
Nenhuma delas é um detector infalível. Os melhores modelos de 2026 conseguem acertar qualquer uma. O truque é que eles quase nunca acertam todas ao mesmo tempo. Uma imagem pode ter mãos impecáveis e texto legível, e então a luz vem de duas direções que não podem existir juntas.
Por que mãos e texto derrubam a IA
Aqui vem a parte que surpreende. O modelo não está desenhando uma mão. Ele não faz ideia de que uma mão exista.
Peter Bentley, cientista da computação da University College London, foi direto numa entrevista à BBC Science Focus: são ‘geradores de imagem em 2D que não têm nenhum conceito da geometria tridimensional de algo como uma mão’. Eles aprendem absorvendo milhões de imagens e captando padrões. Uma mão costuma ter uma palma, alguns dedos e algumas unhas. Mas, como diz Bentley, ‘nenhum desses modelos entende de verdade o que é o conjunto’.
Pense menos como um pintor e mais como um autocompletar de pixels. O modelo prevê o que deveria vir a seguir com base no que viu, sem nunca contar até cinco nem raciocinar qual dedo vai onde. Peça duas mãos com os dedos entrelaçados e, nas palavras de Bentley, você pode acabar com ‘dois pulsos e uma bola de dedos’. Ele está adivinhando uma forma que viu muito, mas que nunca compreendeu de verdade.
Isso também explica o problema dos dados de treinamento. Na maioria das fotos, as mãos são uma bagunça. Estão meio escondidas, fechadas em punho, acenando, segurando uma xícara de café ou viradas de um jeito que mostra só dois dedos. Os rostos encaram a câmera de frente em milhões de fotos limpas, então os modelos veem rostos em todos os ângulos e luzes. As mãos eles veem principalmente em plena ação e meio encobertas, então uma mão relaxada, com os dedos abertos e de frente, é estranhamente rara nos dados. O modelo acaba ótimo no que viu com clareza e vacilante no que viu em pedaços.
O texto é a mesma história com outra roupa. Para o modelo, letras são formas, não linguagem. Ele sabe que uma placa deveria ter marcas parecidas com letras, então pinta marcas parecidas com letras. De perto, num título, os modelos novos sabem escrever. Leve para uma vitrine distante ou uma parede de letras miúdas e ele volta aos rabiscos que só parecem palavras de longe.
O que os modelos novos consertaram, e o que não
Seria injusto fingir que nada mudou. Mudou muito.
A pele agora parece real, com poros e granulação em vez daquele brilho de cera. Os olhos combinam. Os rostos têm microexpressões que escapam da velha rigidez do vale da estranheza. Texto curto e em destaque costuma sair limpo. Mãos simples em repouso, aquelas apenas apoiadas no colo, geralmente saem bem. Se você visse hoje uma imagem de ponta sem nenhuma pista, não piscaria.
O que resiste é tudo o que exige que o modelo entenda regras em vez de copiar aparências. A física é a grande. Um reflexo tem que obedecer à geometria. Uma sombra tem que combinar com a luz. Uma mão em volta de uma xícara tem que saber que a xícara está na frente de alguns dedos e atrás de outros. Não são problemas de textura, são problemas de lógica, e um buscador de padrões não faz lógica. Bentley aponta que a correção provavelmente passe por treinar com formas 3D reais para que os modelos ‘entendam a forma por trás das imagens’, e já há trabalhos iniciais nessa direção, mas as ferramentas do dia a dia que você usa continuam pintando palpites planos.
Se você tem curiosidade sobre o quanto a área avançou no problema do texto, fomos a fundo nisso em a IA finalmente aprendeu a escrever nas imagens. E se você só quer saber qual ferramenta dá os resultados mais limpos hoje, colocamos elas lado a lado em os melhores geradores de imagem com IA.
Como conseguir imagens de IA que não pareçam falsas
Saber por que as imagens quebram diz exatamente como evitar isso. Você está afastando o modelo daquilo em que ele patina.
Deixe as mãos calmas ou fora do quadro. Se uma mão não precisa estar fazendo algo delicado, não faça. Peça mãos em repouso, nos bolsos, ou simplesmente enquadre mais perto. Um retrato do peito para cima escapa do problema todo.
Não peça para a imagem carregar as suas palavras. Se você precisa de um título, um logo ou uma legenda, acrescente depois em qualquer ferramenta de design. Deixe o modelo fazer a imagem e coloque você mesmo o texto real por cima. Vai sair nítido, correto e seu.
Descreva a luz. Diga de onde ela vem. ‘Luz suave de janela pela esquerda’ dá ao modelo uma regra a seguir, e as sombras e os reflexos tendem a cair no lugar em vez de apontar para direções aleatórias.
Gere, corrija e gere de novo. O primeiro resultado é um rascunho. Encontre a pista, ajuste o prompt ou mexa num detalhe, e rode de novo. Quem consegue imagens limpas não tem sorte, apenas faz duas ou três passadas. Aqui ajuda trabalhar num só lugar, porque você pode gerar, ver a placa derretida e rodar de novo sem pular entre apps. O mesmo truque move muitas das fotos de produto feitas com IA: algumas passadas rápidas, não um único prompt perfeito.
Aproveite o ‘imperfeito’ de propósito. Uma foto com um pouco de granulação, descentralizada e com ar real passa mais autenticidade do que uma impecável. Já virou toda uma estética, e escrevemos sobre por que as fotos de IA parecem imperfeitas de propósito.
O honesto não é que as imagens de IA sejam ruins. É que elas são confiantes, e confiança não é a mesma coisa que estar certo. Passe trinta segundos nos cantos do quadro e você vai saber. E aí, quando fizer as suas, dá para mirar a ferramenta no que ela faz bem e contornar sem alarde todo o resto.