Yapay zeka görselleri neden hâlâ sahte görünüyor
Yazar Chatday Editorial Team ·
Bir şefin akşam yemeğini tabağa yerleştirdiği fotoğrafa üç saniyedir bakıyorsun, derken el gözüne çarpıyor. Başparmak yanlış yöne bükülüyor ve dördüncü parmağın olması gereken yerde beşinci bir parmak var. Geri kalan her şey harika. Buhar, ışık, tabaktaki o küçük kızarma izleri. Ama o el her şeyi ele veriyor ve artık görmezden gelemiyorsun.
Yapay zeka görsel araçları çok yol katetti. Bir kuşak önce yüzleri bulaştırıyor, dişleri piyano tuşlarına çeviriyorlardı. Şimdi neredeyse herkesi kandıran bir portre üretebiliyorlar. Neredeyse. Yanılsamanın çatladığı hâlâ küçük bir grup yer var ve nereye bakacağını bir kez öğrenince onları her yerde görüyorsun.
İşte gerçekte olan şu: teni ve saçı harika boyayan bir aracın neden hâlâ bir elde ya da bir sokak tabelasında tökezlediği ve bunun bu araçların nasıl ‘gördüğü’ hakkında ne söylediği.
Hâlâ işe yarayan ipuçları
Eski ipuçlarının bazıları öldü. Plastik, rötuşlanmış ten ve iki gözdeki o birbirinin aynı parıltılar eskiden ‘sahte’ diye bağırırdı. Yeni modeller ten dokusunu ve göz yansımalarını artık iyi hallediyor, dolayısıyla tek başlarına bir anlam ifade etmiyorlar.
Peki ne hâlâ sıyrılıyor? Modelin aynı anda pek çok küçük ayrıntıyı tutarlı tutması gereken bir avuç yer.
| Nereye bakmalı | Onu ele veren şey | Neden oluyor |
|---|---|---|
| Hareket hâlindeki eller | Bir şeyi kavrarken, üst üste binerken ya da tutarken fazladan veya birleşmiş parmaklar | Poz karmaşık ve ayrıntılar minik, bu yüzden en son ve en kötü işlenirler |
| Arka plandaki yazı | Uzaktaki bir tabelada, kitap sırtında ya da etikette eriyen harfler | Model çabasını konuya harcar, küçük yazıya değil |
| Yansımalar ve gölgeler | Başka bir şey gösteren bir ayna, hiçbir yeri işaret etmeyen gölgeler | Fiziksel olarak doğru değil, akla yatkın görünen bir yansıma boyar |
| Tekrar eden desenler | Kıvrılan tuğla sıraları, kare boyunca boyut değiştiren fayanslar | Tüm görselde matematiksel olarak düzgün bir ızgarayı korumak zordur |
| Takı ve kenarlar | Bileğe yarı yarıya kaynayan bir saat, tene karışan bir yüzük | İki yüzeyin temiz biçimde birleşmesi, tam da zorlandığı sınırdır |
Bunların hiçbiri kusursuz bir test değil. 2026’nın en iyi modelleri herhangi birini tutturabilir. İşin püf noktası, neredeyse hiçbir zaman hepsini birden tutturamamaları. Bir görselde kusursuz eller ve okunaklı yazı olabilir, sonra da ışık aynı anda var olamayacak iki yönden gelir.
Eller ve yazı yapay zekayı neden yanıltıyor
İşte şaşırtan kısım. Model bir el çizmiyor. Bir elin var olduğundan haberi yok.
University College London’dan bilgisayar bilimci Peter Bentley, BBC Science Focus’a verdiği bir söyleşide açıkça söyledi: bunlar ‘bir el gibi bir şeyin üç boyutlu geometrisi hakkında hiçbir kavrayışı olmayan 2D görsel üreticileri’. Milyonlarca görseli içlerine çekip örüntüleri yakalayarak öğreniyorlar. Bir elde genelde bir avuç içi, birkaç parmak ve birkaç tırnak vardır. Ama Bentley’nin dediği gibi, ‘bu modellerin hiçbiri bütünün ne olduğunu gerçekten anlamıyor’.
Bunu bir ressamdan çok, pikseller için otomatik tamamlama gibi düşün. Model, gördüğüne dayanarak sonra ne gelmesi gerektiğini tahmin eder, asla beşe kadar saymadan ya da hangi parmağın nereye gittiğini akıl yürütmeden. Ondan parmakları iç içe geçmiş iki el iste, Bentley’nin sözleriyle, elinde ‘iki bilek ve bir parmak topu’ kalabilir. Çokça gördüğü ama hiçbir zaman gerçekten kavramadığı bir biçimi tahmin ediyor.
Bu, eğitim verisi sorununu da açıklıyor. Çoğu fotoğrafta eller karmakarışıktır. Yarı gizli, yumruk yapılmış, el sallarken, bir kahve fincanı tutarken ya da yalnızca iki parmağı görünecek şekilde döndürülmüş hâldedir. Yüzler milyonlarca temiz karede doğrudan kameraya bakar, bu yüzden modeller yüzleri her açıdan ve her ışıkta görür. Elleri ise çoğunlukla hareket hâlinde ve yarı örtülü görürler, bu yüzden rahat, parmakları açık, öne dönük bir el veride tuhaf biçimde nadirdir. Model, net gördüğü şeyde harika, parçalar hâlinde gördüğü şeyde ise tutuk olur.
Yazı da başka bir kılıkta aynı hikaye. Model için harfler bir dil değil, biçimdir. Bir tabelanın harfe benzer işaretler taşıması gerektiğini bilir, o yüzden harfe benzer işaretler boyar. Yakından, bir başlıkta yeni modeller yazabiliyor. Onu uzaktaki bir vitrine ya da küçük yazı dolu bir duvara it, uzaktan yalnızca kelimeye benzeyen karalamalara geri döner.
Yeni modeller neyi düzeltti, neyi düzeltmedi
Hiçbir şey değişmemiş gibi davranmak haksızlık olur. Çok şey değişti.
Ten artık gerçek görünüyor, o mumsu parlaklık yerine gözenekler ve tanecikle. Gözler birbirini tutuyor. Yüzlerde, tekinsiz vadinin eski katılığından sıyrılan mikro ifadeler var. Kısa, öne çıkan yazı çoğu zaman temiz çıkıyor. Basit, dinlenen eller, sadece kucakta duranlar, genelde iyi çıkıyor. Bugün tek bir ipucu bile olmayan üst düzey bir görsel görsen, gözünü kırpmazdın.
Direnen şey, modelin görünüşü kopyalamak yerine kuralları anlamasını gerektiren her şey. Fizik en büyüğü. Bir yansıma geometriye uymak zorunda. Bir gölge ışıkla uyuşmak zorunda. Bir fincanı saran bir elin, fincanın bazı parmakların önünde, bazılarının arkasında olduğunu bilmesi gerek. Bunlar doku sorunu değil, mantık sorunu ve bir örüntü arayıcı mantık yürütmez. Bentley, çözümün büyük olasılıkla modellerin ‘görsellerin ardındaki biçimi anlaması’ için gerçek 3D biçimler üzerinde eğitmekten geçtiğini belirtiyor ve bu yönde erken çalışmalar zaten var, ama kullandığın gündelik araçlar hâlâ düz tahminler boyuyor.
Alanın özellikle yazı sorununda ne kadar yol aldığını merak ediyorsan, bunu yapay zeka sonunda görsellerde yazmayı öğrendi yazısında derinlemesine ele aldık. Yalnızca bugün en temiz sonuçları hangi aracın verdiğini bilmek istiyorsan, onları en iyi yapay zeka görsel üreticileri yazısında yan yana dizdik.
Sahte görünmeyen yapay zeka görselleri nasıl elde edilir
Görsellerin neden bozulduğunu bilmek, bundan tam olarak nasıl kaçınacağını söyler. Modeli, beceremediği şeyden uzaklaştırıyorsun.
Elleri sakin tut ya da kadrajın dışında bırak. Bir elin ince bir iş yapması gerekmiyorsa, yaptırma. Dinlenen eller, cepte eller iste ya da sadece daha dar kadrajla çek. Göğüsten yukarısı bir portre bütün sorunu atlatır.
Görselden senin sözlerini taşımasını isteme. Bir başlık, bir logo ya da bir alt yazı gerekiyorsa, sonradan herhangi bir tasarım aracında ekle. Bırak model görseli yapsın, gerçek yazıyı üstüne kendin koy. Net, doğru ve senin olacak.
Işığı tarif et. Nereden geldiğini söyle. ‘Soldan yumuşak pencere ışığı’ modele uyulacak bir kural verir, gölgeler ve yansımalar da rastgele yönleri göstermek yerine yerine oturma eğiliminde olur.
Oluştur, düzelt, yeniden oluştur. İlk sonuç bir taslaktır. İpucunu yakala, istemi ayarla ya da tek bir ayrıntıyı değiştir ve yeniden çalıştır. Temiz görsel alanlar şanslı değil, sadece iki üç tur atıyor. Burada tek bir yerde çalışmak işe yarar, çünkü oluşturup eriyen tabelayı görebilir ve uygulamalar arasında zıplamadan yeniden çalıştırabilirsin. Aynı numara, yapay zekayla yapılan ürün fotoğraflarının çoğunu da sürükler: tek bir kusursuz istem değil, birkaç hızlı tur.
‘Kusurlu’ olanı bilerek kullan. Hafif taneli, ortalanmamış, gerçek hissi veren bir kare, kusursuz olandan daha özgün okunur. Bu artık başlı başına bir estetik ve yapay zeka fotoğrafları neden bilerek kusurlu görünüyor yazısında bunun nedenini yazdık.
Dürüst olan şu: mesele yapay zeka görsellerinin kötü olması değil. Mesele kendinden emin olmaları ve kendinden emin olmak, haklı olmakla aynı şey değil. Kadrajın köşelerine otuz saniye ayır, anlarsın. Sonra da kendininkileri yaparken aracı iyi olduğu şeye yöneltip geri kalanı sessizce baypas edebilirsin.