AI画像がまだ偽物っぽく見える理由
著者 Chatday Editorial Team ·
シェフが夕食を盛りつける写真を3秒ほど見たところで、手に気づきます。親指が逆向きに曲がり、4本目があるべき場所に5本目の指があります。ほかはすべて美しい。湯気も、光も、皿のあの小さな焼き目も。でもその手がすべてを台無しにして、もう見なかったことにはできません。
AI画像ツールはずいぶん進化しました。ひと世代前は顔をにじませ、歯をピアノの鍵盤に変えていました。いまではほとんど誰でもだませる肖像をつくれます。ほとんど、です。まだ幻がほころびる場所が少しだけ残っていて、どこを見ればいいか分かると、あちこちで目についてきます。
というわけで、実際に起きているのはこういうことです。肌や髪はみごとに描くツールが、なぜいまも手や街の看板でつまずくのか。そして、それがこうしたツールの’見え方’について何を教えてくれるのか。
いまも通じる手がかり
古い手がかりのいくつかは死にました。プラスチックのような加工肌や、両目にそっくり同じに入るハイライトは、かつて’偽物’と叫んでいました。新しいモデルは肌の質感や目の反射をうまく扱えるようになったので、それだけではもう決め手になりません。
では、まだすり抜けるのは何か。モデルが小さな要素をいくつも同時につじつま合わせしなければならない、ひと握りの場所です。
| どこを見るか | 何がばれるか | なぜ起きるか |
|---|---|---|
| 動いている手 | 何かをつかむ、重なる、握るときに増えた指や癒着した指 | ポーズが複雑で細部が小さく、最後にいちばん粗く描かれるため |
| 背景の文字 | 遠い看板、本の背、ラベルで溶けたような文字 | モデルは主役に力を注ぎ、細かい文字には注がないため |
| 反射と影 | 別のものを映す鏡、どこも指していない影 | 物理的に正しい反射ではなく、それらしく見える反射を描くため |
| 繰り返しの模様 | 湾曲するレンガの列、画面内で大きさが変わるタイル | 画面全体で数学的に均一な格子を保つのが難しいため |
| 装身具と輪郭 | 手首に半分溶けこむ腕時計、肌と一体化する指輪 | 二つの面がきれいに接する境目こそ、苦手なところ |
どれも万能の判定法ではありません。2026年の最良のモデルは、そのどれか一つなら決められます。仕掛けは、全部を一度には、ほぼ決められないこと。ある画像は完璧な手と読める文字を備えていて、それでいて光が、同時には存在しえない二方向から差している、ということが起きます。
なぜ手と文字はAIをつまずかせるのか
ここが驚くところです。モデルは手を描いているのではありません。手が存在することさえ分かっていないのです。
ユニバーシティ・カレッジ・ロンドンの計算機科学者ピーター・ベントリー氏は、BBC Science Focus のインタビューではっきり述べています。これらは’手のようなものの三次元的な形状という概念をまったく持たない、2Dの画像生成器’だ、と。何百万枚もの画像を吸い込み、パターンを拾って学びます。手にはたいてい手のひらがあり、指が何本かあり、爪が何枚かある。けれどベントリー氏いわく、‘これらのモデルはどれも、その全体が何なのかを本当には理解していない’のです。
画家というより、ピクセルの自動補完だと考えてください。モデルは、見てきたものをもとに次に来るべきものを予測するだけで、5まで数えることも、どの指がどこに行くかを考えることもありません。指をからめた両手を頼むと、ベントリー氏の言葉を借りれば、‘二つの手首と指の塊’になりかねません。さんざん見てきたのに一度も本当には理解していない形を、当て推量しているのです。
これは学習データの問題も説明します。たいていの写真で、手はぐちゃぐちゃです。半分隠れていたり、こぶしに握られていたり、手を振っていたり、コーヒーカップを持っていたり、二本の指しか見えない角度にひねられていたりします。顔は何百万枚もの整った写真でまっすぐカメラを見るので、モデルはあらゆる角度と光で顔を見ます。手はたいてい動作の最中で半分隠れて見えるので、力を抜いて指を広げ、正面を向いた手はデータの中で妙に珍しいのです。モデルは、はっきり見たものは得意になり、断片で見たものは頼りなくなります。
文字も、装いを変えた同じ話です。モデルにとって文字は言語ではなく形です。看板には文字らしい印がのっているはずだと知っているので、文字らしい印を描きます。近くの見出しなら、新しいモデルは文字を書けます。遠い店先や、細かい文字だらけの壁に押し出すと、遠くから見たときだけ言葉に見える走り書きに戻ります。
新しいモデルが直したもの、直せていないもの
何も変わっていないふりをするのは不公平でしょう。多くが変わりました。
肌はいまや本物らしく、あの蝋のような光沢の代わりに毛穴や粒子があります。両目はそろっています。顔には、昔の不気味の谷のこわばりをかわす微妙な表情があります。短くて目立つ文字は、たいていきれいに出ます。ひざの上に置いただけのような、単純で休んでいる手は、たいていうまくいきます。今日、手がかりが一つもない最先端の画像を見ても、まばたき一つしないでしょう。
抵抗するのは、見た目を写すのではなく規則を理解することをモデルに求める、あらゆるものです。物理が大物です。反射は幾何学に従わなければなりません。影は光と合わなければなりません。カップを包む手は、カップが一部の指の前にあり、ほかの指の後ろにあることを知っていなければなりません。これは質感の問題ではなく、論理の問題で、パターン探し屋は論理をしません。ベントリー氏は、解決はおそらく、モデルが’画像の背後にある形を理解する’よう本物の3D形状で学習させることにあると述べていて、その方向の初期の研究はすでにありますが、あなたが使う日常のツールは、いまも平たい当て推量を描いています。
とりわけ文字の問題でこの分野がどこまで来たのか気になるなら、AIはついに画像の中で文字を書けるようになったで掘り下げました。今日いちばんきれいな結果を出すツールが知りたいだけなら、最良のAI画像生成ツールで並べて比べています。
偽物っぽく見えないAI画像を得る方法
画像が壊れる理由を知れば、それを避ける方法もそのまま分かります。モデルを、下手なところから遠ざけているのです。
手は静かに、あるいは画面の外に。 手が細かい何かをする必要がないなら、させないでください。休んだ手、ポケットの中の手を頼むか、いっそ寄りで切り取りましょう。胸から上の肖像は、問題まるごとを避けられます。
あなたの言葉を画像に背負わせないでください。 見出しやロゴ、キャプションが要るなら、あとから好きなデザインツールで足しましょう。画像はモデルにつくらせ、本物の文字は自分で上に載せる。くっきり、正しく、あなたのものになります。
光を説明してください。 どこから来るかを言いましょう。‘左の窓からの柔らかい光’はモデルに従うべき規則を与え、影や反射は、でたらめな方向を指す代わりに、しかるべき場所に収まりやすくなります。
生成し、直し、また生成する。 最初の結果は下書きです。手がかりを見つけ、プロンプトを整えるか、細部を一つ変えて、もう一度回します。きれいな画像を得る人は運がいいのではなく、ただ二、三回まわしているだけです。ここで一か所で作業できると効きます。生成して、溶けた看板を見つけて、アプリを行き来せずにまた回せるからです。同じ手が、AIでつくる商品写真の多くも動かしています。完璧なプロンプト一発ではなく、素早い数回です。
‘不完全さ’をわざと生かす。 少し粒子があって、中心をはずした、本物っぽい一枚は、非の打ちどころのない一枚より本物らしく読まれます。もう一つの美学になっていて、その理由はAIの写真がわざと不完全に見えるで書きました。
正直なところ、AI画像がだめだ、という話ではありません。自信満々だ、という話です。そして自信は、正しさと同じではありません。画面の隅に30秒かければ、分かります。そのうえで自分の一枚をつくるときは、ツールを得意なところに向け、残りはそっと避けて回ればいいのです。