比較模型 比較圖像模型 AI 工具 模型 AI 圖像模型 AI 資訊 搜尋 免費試用
解說 8 分鐘閱讀

為什麼 AI 圖片看起來還是假假的

作者 Chatday Editorial Team ·

aiexplainerimage-generationhow-it-worksai-images
為什麼 AI 圖片看起來還是假假的

你盯著一張主廚擺盤晚餐的照片才三秒,就注意到那隻手。拇指往錯的方向彎,本該是第四根手指的位置卻多了第五根。其他一切都很美。蒸氣、光線、盤子上那些小小的焦痕。但那隻手把一切都露了餡,而你現在再也無法視而不見。

AI 圖片工具走了很長一段路。一個世代以前,它們把臉塗得糊糊的,把牙齒變成鋼琴鍵。如今它們能做出幾乎騙過任何人的肖像。幾乎。仍有一小群地方會讓幻覺裂開,而一旦你知道要看哪裡,就會到處都看見。

所以,實際發生的是這樣:一個能把皮膚和頭髮畫得很美的工具,為什麼還是會在一隻手或一塊街頭招牌上翻船,而這又透露了這些工具是怎麼’看’的。

仍然有效的破綻

有些老線索已經死了。塑膠般、修過的皮膚,還有兩眼裡一模一樣的反光,以前都在大喊’假的’。新模型如今把皮膚質感和眼睛反光處理得很好,所以單看它們已經沒有意義了。

那還有什麼會漏出來?就那麼一小把地方,模型得同時把許多小東西維持一致。

要看哪裡什麼露了餡為什麼會這樣
動作中的手在抓握、交疊或拿東西時多出來或黏在一起的手指姿勢複雜、細節又極小,所以最後才畫、也畫得最差
背景裡的字遠處招牌、書背或標籤上融化般的字模型把力氣花在主角,而不是小字上
反射與陰影照出別的東西的鏡子、指向不知哪裡的陰影它畫的是看起來合理的反射,而不是物理正確的
重複的圖案會彎曲的磚列、在畫面裡改變大小的地磚要在整張圖上維持數學般均勻的格線很難
首飾與邊緣半融進手腕的手錶、與皮膚化為一體的戒指兩個表面乾淨地相接,正是它最吃力的邊界

這些沒有一個是萬無一失的測試。2026 年最好的模型,任何一項都能做對。訣竅在於,它們幾乎從不一次全部做對。一張圖可以有無可挑剔的手和讀得出的字,然後光卻從兩個不可能同時存在的方向照過來。

為什麼手和字會讓 AI 絆倒

驚訝的部分來了。模型並不是在畫一隻手。它根本不知道有手這種東西存在。

倫敦大學學院的電腦科學家 Peter Bentley 在接受 BBC Science Focus 訪問時直言:這些是’對像手這種東西的三維幾何毫無概念的 2D 圖片生成器’。它們靠吸收數百萬張圖片、抓取規律來學習。一隻手通常有手掌、幾根手指和幾片指甲。但正如 Bentley 所說,‘這些模型沒有一個真正理解整體是什麼’。

與其把它想成畫家,不如想成像素的自動完成。模型根據看過的東西,預測接下來該出現什麼,從不數到五,也不推理哪根手指該在哪裡。請它畫兩隻手指交扣的手,用 Bentley 的話說,你可能會得到’兩個手腕和一團手指’。它是在猜一個看過無數次、卻從未真正理解的形狀。

這也解釋了訓練資料的問題。在大多數照片裡,手是一團亂。它們半遮半掩、握成拳頭、揮著手、抓著一杯咖啡,或轉成只露出兩根手指的角度。臉在數百萬張乾淨照片裡直視鏡頭,所以模型看過各種角度和光線下的臉。手則多半在動作中、被半遮擋著被看見,所以一隻放鬆、張開、正對前方的手,在資料裡少得出奇。模型在它看清楚的東西上變得很厲害,在只看到片段的東西上則搖搖晃晃。

字是換了件衣服的同一個故事。對模型來說,字母是形狀,不是語言。它知道招牌上該有像字母的記號,於是就畫像字母的記號。近看、在大標題上,新模型會拼字。把它推到遠處的櫥窗或一整面小字的牆上,它又退回到那種只有遠看才像字的塗鴉。

新模型修好了什麼,又沒修好什麼

假裝什麼都沒變並不公平。變了很多。

皮膚現在看起來是真的,有毛孔和顆粒,而不是那種蠟一般的光澤。兩眼對得上。臉上有微表情,避開了過去恐怖谷的僵硬。短而醒目的字,往往乾淨地出現。簡單、休息中的手,就是擱在膝上那種,通常沒問題。你今天要是看到一張沒有任何破綻的頂尖圖片,眼睛連眨都不會眨。

頑強抵抗的,是所有要求模型理解規則、而不是照抄外表的東西。物理是大魔王。反射得服從幾何。陰影得跟光線對得上。一隻握住杯子的手,得知道杯子在某些手指的前面、在另一些手指的後面。這些不是質感問題,是邏輯問題,而找規律的東西不會做邏輯。Bentley 指出,解法大概要靠用真正的 3D 形狀來訓練,讓模型’理解圖片背後的形狀’,這個方向已有早期的研究,但你日常用的工具,仍然在畫平面的猜測。

如果你好奇這個領域在字的問題上走了多遠,我們在AI 終於學會在圖片裡寫字裡深入談過。如果你只想知道今天哪個工具給出最乾淨的結果,我們在最好的 AI 圖片生成工具裡把它們排在一起比。

怎麼做出不像假的 AI 圖片

知道圖片為什麼會壞,就正好告訴你怎麼避開。你是在把模型帶離它會搞砸的地方。

讓手安靜下來,或乾脆移出畫面。 如果一隻手不需要做什麼精細的事,就別讓它做。要它放鬆的手、插口袋的手,或乾脆裁得更近。從胸口以上的肖像,整個問題都繞過去了。

別要圖片扛你的文字。 如果你需要標題、標誌或說明文字,事後用任何一個設計工具加上去。讓模型做圖,真正的字自己疊在上面。它會清晰、正確,而且是你的。

把光描述出來。 說它從哪裡來。‘左邊窗戶灑進來的柔光’給了模型一條可以遵守的規則,陰影和反射也比較會各就各位,而不是指向隨機的方向。

生成、修正、再生成。 第一個結果是草稿。找出破綻,調一調提示詞或改一個細節,再跑一次。能拿到乾淨圖片的人不是運氣好,只是多跑了兩三輪。在同一個地方作業在這裡很有幫助,因為你可以生成、看到融化的招牌,然後不用在不同 app 之間跳來跳去就再跑一次。同一招也推動了許多用 AI 做的產品照:幾次快速的來回,而不是一個完美的提示詞。

刻意用上’不完美’。 一張略帶顆粒、沒對正中心、有真實味道的照片,讀起來比無懈可擊的更真。這如今自成一種美學,我們也寫過為什麼AI 照片刻意看起來不完美。

不一定。2026 年最好的模型,每一項單獨的檢查都能通過。可靠的做法是把檢查合起來:同時看手、背景的字、反射和重複的圖案,因為一張假圖很少一次全部做對。
因為它不把手當成一個 3D 物體來理解。它是從看過的規律預測像素,而訓練照片裡手出現得少、又半遮半掩,所以複雜的姿勢會畫出多出來或黏在一起的手指。
其實沒了。光滑的皮膚和一模一樣的眼睛反光現在都處理得很好。改看物理吧:陰影、反射,以及物體怎麼互相交疊。
把手保持簡單或移出畫面,文字事後自己加,描述光從哪裡來,並且多跑兩三輪,而不是期待第一次就完美。

老實說,重點不是 AI 圖片很爛。重點是它們很有自信,而自信和正確不是同一回事。花三十秒看看畫面的角落,你就會知道。接著,當你做自己的圖時,可以把工具對準它擅長的地方,其餘的悄悄繞過去。