Dlaczego obrazy AI wciąż wyglądają sztucznie
Autor Chatday Editorial Team ·
Patrzysz od trzech sekund na zdjęcie szefa kuchni układającego kolację na talerzu, gdy zauważasz dłoń. Kciuk zgina się w złą stronę, a piąty palec jest tam, gdzie powinien być czwarty. Cała reszta jest przepiękna. Para, światło, te małe przypieczenia na talerzu. Ale ta dłoń zdradza wszystko i teraz już nie możesz tego odzobaczyć.
Narzędzia do obrazów AI przeszły długą drogę. Pokolenie temu rozmazywały twarze i zamieniały zęby w klawisze fortepianu. Dziś tworzą portret, który nabiera niemal każdego. Niemal. Wciąż zostaje niewielka grupa miejsc, w których iluzja pęka, a gdy już wiesz, gdzie patrzeć, widzisz je wszędzie.
Więc oto co dzieje się naprawdę: dlaczego narzędzie, które pięknie maluje skórę i włosy, wciąż potyka się na dłoni albo na ulicznym szyldzie, i co to mówi o tym, jak te narzędzia ‘widzą’.
Sygnały, które wciąż działają
Niektóre stare tropy umarły. Plastikowa, wyretuszowana skóra i te identyczne błyski w obu oczach kiedyś krzyczały ‘podróbka’. Nowe modele radzą sobie już dobrze z fakturą skóry i odblaskami oczu, więc same w sobie nic już nie znaczą.
Co wciąż się prześlizguje? Garść miejsc, w których model musi utrzymać spójność wielu drobiazgów naraz.
| Gdzie patrzeć | Co zdradza | Dlaczego tak jest |
|---|---|---|
| Dłonie w ruchu | Dodatkowe lub zrośnięte palce przy chwytaniu, nakładaniu się czy trzymaniu czegoś | Poza jest złożona, a detale malutkie, więc powstają na końcu i najgorzej |
| Tekst w tle | Rozpływające się litery na dalekim szyldzie, grzbiecie książki albo etykiecie | Model wkłada wysiłek w główny obiekt, nie w drobny druk |
| Odbicia i cienie | Lustro pokazujące coś innego, cienie, które nie wskazują żadnego kierunku | Maluje odbicie, które wygląda wiarygodnie, a nie fizycznie poprawne |
| Powtarzalne wzory | Rzędy cegieł, które się wyginają, płytki zmieniające rozmiar w kadrze | Utrzymanie matematycznie równej siatki w całym obrazie jest trudne |
| Biżuteria i krawędzie | Zegarek wtapiający się w połowie w nadgarstek, pierścionek zlewający się ze skórą | Dwie powierzchnie stykające się czysto to właśnie granica, która sprawia mu trudność |
Żaden z nich nie jest niezawodnym testem. Najlepsze modele 2026 potrafią trafić każdy z osobna. Sztuczka w tym, że prawie nigdy nie trafiają wszystkich naraz. Obraz może mieć nienaganne dłonie i czytelny tekst, a potem światło pada z dwóch kierunków, które nie mogą istnieć razem.
Dlaczego dłonie i tekst podkładają AI nogę
Teraz część, która zaskakuje. Model nie rysuje dłoni. Nie ma pojęcia, że dłoń istnieje.
Peter Bentley, informatyk z University College London, powiedział to wprost w wywiadzie dla BBC Science Focus: to ‘generatory obrazów 2D, które nie mają żadnego pojęcia o trójwymiarowej geometrii czegoś takiego jak dłoń’. Uczą się, wchłaniając miliony obrazów i wychwytując wzorce. Dłoń zwykle ma wnętrze, kilka palców i kilka paznokci. Ale, jak mówi Bentley, ‘żaden z tych modeli naprawdę nie rozumie, czym jest całość’.
Pomyśl o tym mniej jak o malarzu, a bardziej jak o autouzupełnianiu pikseli. Model przewiduje, co powinno pojawić się dalej, na podstawie tego, co widział, nie licząc nigdy do pięciu ani nie zastanawiając się, który palec gdzie idzie. Poproś o dwie dłonie ze splecionymi palcami, a możesz dostać, mówiąc słowami Bentleya, ‘dwa nadgarstki i kulę palców’. Zgaduje kształt, który widział mnóstwo razy, lecz nigdy naprawdę nie pojął.
To tłumaczy też problem z danymi treningowymi. Na większości zdjęć dłonie to bałagan. Są w połowie ukryte, zaciśnięte w pięść, machają, ściskają kubek kawy albo obrócone tak, że widać tylko dwa palce. Twarze patrzą prosto w obiektyw na milionach czystych ujęć, więc modele widzą twarze pod każdym kątem i w każdym świetle. Dłonie widzą głównie w pełnym ruchu i w połowie zasłonięte, więc rozluźniona, rozłożona, zwrócona do przodu dłoń jest w danych dziwnie rzadka. Model staje się świetny w tym, co widział wyraźnie, i chwiejny w tym, co widział w kawałkach.
Tekst to ta sama historia w innym przebraniu. Dla modelu litery to kształty, nie język. Wie, że szyld powinien nosić znaki podobne do liter, więc maluje znaki podobne do liter. Z bliska, na nagłówku, nowe modele potrafią pisać. Przenieś to na daleką witrynę albo ścianę drobnego druku, a wraca do gryzmołów, które wyglądają jak słowa tylko z daleka.
Co nowe modele naprawiły, a czego nie
Byłoby nieuczciwie udawać, że nic się nie zmieniło. Zmieniło się dużo.
Skóra wygląda teraz prawdziwie, z porami i ziarnem zamiast tego woskowego połysku. Oczy pasują. Twarze mają mikroekspresje, które omijają dawną sztywność doliny niesamowitości. Krótki, wyeksponowany tekst często wychodzi czysto. Proste, spoczywające dłonie, te po prostu leżące na kolanach, zwykle się udają. Gdybyś zobaczył dziś topowy obraz bez ani jednego tropu, nie mrugnąłbyś okiem.
To, co się opiera, to wszystko, co wymaga od modelu rozumienia reguł zamiast kopiowania wyglądu. Fizyka to duża rzecz. Odbicie musi słuchać geometrii. Cień musi zgadzać się ze światłem. Dłoń wokół kubka musi wiedzieć, że kubek jest przed jednymi palcami, a za innymi. To nie są problemy z fakturą, to problemy z logiką, a wyszukiwacz wzorców nie robi logiki. Bentley zauważa, że rozwiązanie zapewne prowadzi przez trenowanie na prawdziwych kształtach 3D, żeby modele ‘rozumiały kształt kryjący się za obrazami’, i są już wczesne prace w tym kierunku, ale codzienne narzędzia, których używasz, wciąż malują płaskie domysły.
Jeśli ciekawi cię, jak daleko dziedzina zaszła akurat z problemem tekstu, zgłębiliśmy to w AI w końcu nauczyła się pisać na obrazach. A jeśli chcesz tylko wiedzieć, które narzędzie daje dziś najczystsze wyniki, zestawiliśmy je w najlepszych generatorach obrazów AI.
Jak uzyskać obrazy AI, które nie wyglądają sztucznie
Wiedza o tym, dlaczego obrazy się psują, mówi dokładnie, jak tego uniknąć. Odsuwasz model od tego, co partaczy.
Trzymaj dłonie spokojne albo poza kadrem. Jeśli dłoń nie musi robić czegoś skomplikowanego, nie każ jej. Poproś o dłonie w spoczynku, w kieszeniach, albo po prostu skadruj ciaśniej. Portret od klatki piersiowej w górę omija cały problem.
Nie każ obrazowi nieść twoich słów. Jeśli potrzebujesz nagłówka, logo albo podpisu, dodaj je potem w dowolnym narzędziu graficznym. Niech model zrobi obraz, a prawdziwy tekst nałóż sam na wierzch. Wyjdzie ostry, poprawny i twój.
Opisz światło. Powiedz, skąd pada. ‘Miękkie światło z okna po lewej’ daje modelowi regułę do trzymania się, a cienie i odbicia zwykle układają się na miejscu, zamiast wskazywać w przypadkowe strony.
Generuj, poprawiaj, generuj ponownie. Pierwszy wynik to szkic. Wypatrz trop, dopracuj prompt albo zmień jeden detal i odpal jeszcze raz. Ci, którzy dostają czyste obrazy, nie mają szczęścia, po prostu robią dwa albo trzy podejścia. Tu pomaga praca w jednym miejscu, bo możesz wygenerować, zobaczyć rozpływający się szyld i odpalić ponownie bez skakania między aplikacjami. Ta sama sztuczka napędza wiele zdjęć produktowych zrobionych z AI: kilka szybkich podejść, a nie jeden idealny prompt.
Wykorzystaj ‘niedoskonałość’ celowo. Ujęcie lekko ziarniste, poza centrum i o prawdziwym wyglądzie czyta się jako bardziej autentyczne niż nieskazitelne. To już cała estetyka, i pisaliśmy o tym, dlaczego zdjęcia AI wyglądają na niedoskonałe celowo.
Uczciwie rzecz biorąc, nie chodzi o to, że obrazy AI są złe. Chodzi o to, że są pewne siebie, a pewność siebie to nie to samo co racja. Poświęć trzydzieści sekund rogom kadru, a będziesz wiedzieć. A potem, gdy tworzysz własne, możesz wycelować narzędzie w to, co robi dobrze, i po cichu obejść całą resztę.