為什麼 AI 圖片看起來還是假假的
作者 Chatday Editorial Team ·
你盯著一張主廚擺盤晚餐的照片才三秒,就注意到那隻手。拇指往錯的方向彎,本該是第四根手指的位置卻多了第五根。其他一切都很美。蒸氣、光線、盤子上那些小小的焦痕。但那隻手把一切都露了餡,而你現在再也無法視而不見。
AI 圖片工具走了很長一段路。一個世代以前,它們把臉塗得糊糊的,把牙齒變成鋼琴鍵。如今它們能做出幾乎騙過任何人的肖像。幾乎。仍有一小群地方會讓幻覺裂開,而一旦你知道要看哪裡,就會到處都看見。
所以,實際發生的是這樣:一個能把皮膚和頭髮畫得很美的工具,為什麼還是會在一隻手或一塊街頭招牌上翻船,而這又透露了這些工具是怎麼’看’的。
仍然有效的破綻
有些老線索已經死了。塑膠般、修過的皮膚,還有兩眼裡一模一樣的反光,以前都在大喊’假的’。新模型如今把皮膚質感和眼睛反光處理得很好,所以單看它們已經沒有意義了。
那還有什麼會漏出來?就那麼一小把地方,模型得同時把許多小東西維持一致。
| 要看哪裡 | 什麼露了餡 | 為什麼會這樣 |
|---|---|---|
| 動作中的手 | 在抓握、交疊或拿東西時多出來或黏在一起的手指 | 姿勢複雜、細節又極小,所以最後才畫、也畫得最差 |
| 背景裡的字 | 遠處招牌、書背或標籤上融化般的字 | 模型把力氣花在主角,而不是小字上 |
| 反射與陰影 | 照出別的東西的鏡子、指向不知哪裡的陰影 | 它畫的是看起來合理的反射,而不是物理正確的 |
| 重複的圖案 | 會彎曲的磚列、在畫面裡改變大小的地磚 | 要在整張圖上維持數學般均勻的格線很難 |
| 首飾與邊緣 | 半融進手腕的手錶、與皮膚化為一體的戒指 | 兩個表面乾淨地相接,正是它最吃力的邊界 |
這些沒有一個是萬無一失的測試。2026 年最好的模型,任何一項都能做對。訣竅在於,它們幾乎從不一次全部做對。一張圖可以有無可挑剔的手和讀得出的字,然後光卻從兩個不可能同時存在的方向照過來。
為什麼手和字會讓 AI 絆倒
驚訝的部分來了。模型並不是在畫一隻手。它根本不知道有手這種東西存在。
倫敦大學學院的電腦科學家 Peter Bentley 在接受 BBC Science Focus 訪問時直言:這些是’對像手這種東西的三維幾何毫無概念的 2D 圖片生成器’。它們靠吸收數百萬張圖片、抓取規律來學習。一隻手通常有手掌、幾根手指和幾片指甲。但正如 Bentley 所說,‘這些模型沒有一個真正理解整體是什麼’。
與其把它想成畫家,不如想成像素的自動完成。模型根據看過的東西,預測接下來該出現什麼,從不數到五,也不推理哪根手指該在哪裡。請它畫兩隻手指交扣的手,用 Bentley 的話說,你可能會得到’兩個手腕和一團手指’。它是在猜一個看過無數次、卻從未真正理解的形狀。
這也解釋了訓練資料的問題。在大多數照片裡,手是一團亂。它們半遮半掩、握成拳頭、揮著手、抓著一杯咖啡,或轉成只露出兩根手指的角度。臉在數百萬張乾淨照片裡直視鏡頭,所以模型看過各種角度和光線下的臉。手則多半在動作中、被半遮擋著被看見,所以一隻放鬆、張開、正對前方的手,在資料裡少得出奇。模型在它看清楚的東西上變得很厲害,在只看到片段的東西上則搖搖晃晃。
字是換了件衣服的同一個故事。對模型來說,字母是形狀,不是語言。它知道招牌上該有像字母的記號,於是就畫像字母的記號。近看、在大標題上,新模型會拼字。把它推到遠處的櫥窗或一整面小字的牆上,它又退回到那種只有遠看才像字的塗鴉。
新模型修好了什麼,又沒修好什麼
假裝什麼都沒變並不公平。變了很多。
皮膚現在看起來是真的,有毛孔和顆粒,而不是那種蠟一般的光澤。兩眼對得上。臉上有微表情,避開了過去恐怖谷的僵硬。短而醒目的字,往往乾淨地出現。簡單、休息中的手,就是擱在膝上那種,通常沒問題。你今天要是看到一張沒有任何破綻的頂尖圖片,眼睛連眨都不會眨。
頑強抵抗的,是所有要求模型理解規則、而不是照抄外表的東西。物理是大魔王。反射得服從幾何。陰影得跟光線對得上。一隻握住杯子的手,得知道杯子在某些手指的前面、在另一些手指的後面。這些不是質感問題,是邏輯問題,而找規律的東西不會做邏輯。Bentley 指出,解法大概要靠用真正的 3D 形狀來訓練,讓模型’理解圖片背後的形狀’,這個方向已有早期的研究,但你日常用的工具,仍然在畫平面的猜測。
如果你好奇這個領域在字的問題上走了多遠,我們在AI 終於學會在圖片裡寫字裡深入談過。如果你只想知道今天哪個工具給出最乾淨的結果,我們在最好的 AI 圖片生成工具裡把它們排在一起比。
怎麼做出不像假的 AI 圖片
知道圖片為什麼會壞,就正好告訴你怎麼避開。你是在把模型帶離它會搞砸的地方。
讓手安靜下來,或乾脆移出畫面。 如果一隻手不需要做什麼精細的事,就別讓它做。要它放鬆的手、插口袋的手,或乾脆裁得更近。從胸口以上的肖像,整個問題都繞過去了。
別要圖片扛你的文字。 如果你需要標題、標誌或說明文字,事後用任何一個設計工具加上去。讓模型做圖,真正的字自己疊在上面。它會清晰、正確,而且是你的。
把光描述出來。 說它從哪裡來。‘左邊窗戶灑進來的柔光’給了模型一條可以遵守的規則,陰影和反射也比較會各就各位,而不是指向隨機的方向。
生成、修正、再生成。 第一個結果是草稿。找出破綻,調一調提示詞或改一個細節,再跑一次。能拿到乾淨圖片的人不是運氣好,只是多跑了兩三輪。在同一個地方作業在這裡很有幫助,因為你可以生成、看到融化的招牌,然後不用在不同 app 之間跳來跳去就再跑一次。同一招也推動了許多用 AI 做的產品照:幾次快速的來回,而不是一個完美的提示詞。
刻意用上’不完美’。 一張略帶顆粒、沒對正中心、有真實味道的照片,讀起來比無懈可擊的更真。這如今自成一種美學,我們也寫過為什麼AI 照片刻意看起來不完美。
老實說,重點不是 AI 圖片很爛。重點是它們很有自信,而自信和正確不是同一回事。花三十秒看看畫面的角落,你就會知道。接著,當你做自己的圖時,可以把工具對準它擅長的地方,其餘的悄悄繞過去。