Perché le immagini IA sembrano ancora finte
Di Chatday Editorial Team ·
Sei da tre secondi sulla foto di uno chef che impiatta la cena quando noti la mano. Il pollice si piega dalla parte sbagliata e c’è un quinto dito dove dovrebbe essercene un quarto. Tutto il resto è bellissimo. Il vapore, la luce, quelle piccole bruciature sul piatto. Ma quella mano svela tutto, e ora non riesci più a non vederlo.
Gli strumenti di immagini IA hanno fatto molta strada. Una generazione fa impastavano i volti e trasformavano i denti in tasti di pianoforte. Ora sanno creare un ritratto che inganna quasi chiunque. Quasi. Resta ancora un piccolo gruppo di punti in cui l’illusione si incrina, e appena sai dove guardare li vedi ovunque.
Ecco allora cosa succede davvero: perché uno strumento che dipinge pelle e capelli in modo splendido inciampa ancora su una mano o su un cartello per strada, e cosa ci dice questo sul modo in cui questi strumenti ‘vedono’.
I segnali che funzionano ancora
Alcuni vecchi indizi sono morti. La pelle di plastica, ritoccata, e quei riflessi identici in entrambi gli occhi una volta gridavano ‘falso’. I modelli nuovi ormai gestiscono bene la texture della pelle e i riflessi degli occhi, quindi da soli non bastano più.
Cosa sfugge ancora? Una manciata di punti in cui il modello deve tenere coerenti tante piccole cose insieme.
| Dove guardare | Cosa lo tradisce | Perché succede |
|---|---|---|
| Mani in azione | Dita in più o fuse quando afferrano, si sovrappongono o tengono qualcosa | La posa è complessa e i dettagli minuscoli, così vengono risolti per ultimi e peggio |
| Testo sullo sfondo | Lettere sciolte su un’insegna lontana, il dorso di un libro o un’etichetta | Il modello spende l’impegno sul soggetto, non sulle scritte piccole |
| Riflessi e ombre | Uno specchio che mostra un’altra cosa, ombre che non puntano da nessuna parte | Dipinge un riflesso che sembra plausibile, non uno fisicamente corretto |
| Motivi ripetuti | File di mattoni che si curvano, piastrelle che cambiano dimensione nell’immagine | Tenere una griglia matematicamente uniforme in tutta l’immagine è difficile |
| Gioielli e bordi | Un orologio che si fonde a metà con il polso, un anello che si mescola alla pelle | Due superfici che si toccano in modo netto sono proprio il confine che gli riesce difficile |
Nessuno di questi è un test infallibile. I migliori modelli del 2026 possono azzeccarne uno qualsiasi. Il trucco è che quasi mai li azzeccano tutti insieme. Un’immagine può avere mani impeccabili e testo leggibile, e poi la luce arriva da due direzioni che non possono coesistere.
Perché mani e testo mandano in tilt l’IA
Ecco la parte che sorprende. Il modello non sta disegnando una mano. Non ha idea che una mano esista.
Peter Bentley, informatico della University College London, è stato netto in un’intervista a BBC Science Focus: sono ‘generatori di immagini in 2D che non hanno alcun concetto della geometria tridimensionale di qualcosa come una mano’. Imparano assorbendo milioni di immagini e cogliendo schemi. Una mano di solito ha un palmo, qualche dito e qualche unghia. Ma, come dice Bentley, ‘nessuno di questi modelli capisce davvero cosa sia l’insieme’.
Pensalo meno come un pittore e più come un completamento automatico di pixel. Il modello prevede cosa dovrebbe venire dopo in base a ciò che ha visto, senza mai contare fino a cinque né ragionare su quale dito vada dove. Chiedigli due mani con le dita intrecciate e, nelle parole di Bentley, puoi ritrovarti con ‘due polsi e una palla di dita’. Sta indovinando una forma che ha visto tantissimo ma che non ha mai davvero compreso.
Questo spiega anche il problema dei dati di addestramento. Nella maggior parte delle foto le mani sono un caos. Sono seminascoste, chiuse a pugno, mentre salutano, mentre stringono una tazza di caffè o girate in modo da mostrare solo due dita. I volti guardano dritti in camera in milioni di scatti puliti, così i modelli vedono volti in ogni angolazione e luce. Le mani le vedono soprattutto in piena azione e mezze coperte, quindi una mano rilassata, con le dita aperte e di fronte, è stranamente rara nei dati. Il modello diventa bravissimo in ciò che ha visto chiaro e incerto in ciò che ha visto a pezzi.
Il testo è la stessa storia con un altro vestito. Per il modello le lettere sono forme, non linguaggio. Sa che un cartello dovrebbe avere segni simili a lettere, così dipinge segni simili a lettere. Da vicino, in un titolo, i modelli nuovi sanno scrivere. Portalo su una vetrina lontana o su un muro di scritte piccole e torna agli scarabocchi che sembrano parole solo da lontano.
Cosa hanno risolto i modelli nuovi, e cosa no
Sarebbe ingiusto fingere che non sia cambiato nulla. È cambiato molto.
La pelle ora sembra vera, con pori e grana al posto di quella lucentezza di cera. Gli occhi combaciano. I volti hanno microespressioni che schivano la vecchia rigidità della valle perturbante. Il testo breve e in evidenza spesso esce pulito. Le mani semplici a riposo, quelle appoggiate in grembo, di solito vengono bene. Se oggi vedessi un’immagine all’avanguardia senza alcun indizio, non batteresti ciglio.
Ciò che resiste è tutto quello che richiede al modello di capire regole invece di copiare apparenze. La fisica è la cosa grossa. Un riflesso deve obbedire alla geometria. Un’ombra deve concordare con la luce. Una mano attorno a una tazza deve sapere che la tazza è davanti ad alcune dita e dietro ad altre. Non sono problemi di texture, sono problemi di logica, e un cercatore di schemi non fa logica. Bentley osserva che la soluzione passa probabilmente dall’addestrare su forme 3D reali perché i modelli ‘capiscano la forma dietro le immagini’, e c’è già del lavoro iniziale in questa direzione, ma gli strumenti di tutti i giorni che usi continuano a dipingere ipotesi piatte.
Se ti incuriosisce quanta strada ha fatto il settore proprio sul problema del testo, lo abbiamo approfondito in l’IA ha finalmente imparato a scrivere nelle immagini. E se vuoi solo sapere quale strumento dà oggi i risultati più puliti, li abbiamo messi a confronto in i migliori generatori di immagini IA.
Come ottenere immagini IA che non sembrino finte
Sapere perché le immagini si rompono ti dice esattamente come evitarlo. Stai allontanando il modello da ciò in cui pasticcia.
Tieni le mani ferme o fuori dall’inquadratura. Se una mano non deve fare qualcosa di delicato, non fargliela fare. Chiedi mani a riposo, in tasca, o semplicemente inquadra più stretto. Un ritratto dal petto in su aggira tutto il problema.
Non chiedere all’immagine di portare le tue parole. Se ti serve un titolo, un logo o una didascalia, aggiungilo dopo con un qualsiasi strumento di grafica. Lascia che il modello faccia l’immagine e metti tu il testo vero sopra. Verrà nitido, corretto e tuo.
Descrivi la luce. Di’ da dove arriva. ‘Luce morbida da una finestra a sinistra’ dà al modello una regola da seguire, e ombre e riflessi tendono ad andare al loro posto invece di puntare in direzioni casuali.
Genera, correggi e rigenera. Il primo risultato è una bozza. Individua l’indizio, ritocca il prompt o sistema un dettaglio, e rilancia. Chi ottiene immagini pulite non è fortunato, fa solo due o tre passaggi. Qui aiuta lavorare in un unico posto, perché puoi generare, notare l’insegna sciolta e rilanciare senza saltare tra le app. Lo stesso trucco muove molte delle foto di prodotto fatte con l’IA: qualche passaggio veloce, non un unico prompt perfetto.
Gioca sull’imperfetto, di proposito. Uno scatto un po’ grezzo, non centrato e dall’aria reale si legge come più autentico di uno impeccabile. È ormai un’estetica a sé, e abbiamo scritto sul perché le foto IA sembrano imperfette di proposito.
La verità non è che le immagini IA siano brutte. È che sono sicure di sé, e la sicurezza non è la stessa cosa che avere ragione. Passa trenta secondi sugli angoli dell’inquadratura e lo saprai. Poi, quando crei le tue, puoi puntare lo strumento su ciò che gli riesce bene e aggirare in silenzio tutto il resto.