لماذا ما زالت صور الذكاء الاصطناعي تبدو مزيفة؟
بقلم Chatday Editorial Team ·
تمضي ثلاث ثوانٍ في تأمل صورة لطاهٍ يزيّن طبق العشاء قبل أن تلاحظ اليد. الإبهام منحنٍ في الاتجاه الخطأ، وهناك إصبع خامس في موضع لا ينبغي أن يظهر فيه إلا الرابع. كل شيء آخر جميل. البخار، والإضاءة، وآثار التحميص الصغيرة على الطبق. لكن تلك اليد تفضح الصورة كلها، ومن تلك اللحظة لن تستطيع تجاهلها.
قطعت أدوات توليد الصور بالذكاء الاصطناعي شوطاً طويلاً. قبل جيل واحد كانت تطمس الوجوه وتحول الأسنان إلى مفاتيح بيانو. الآن تستطيع إنتاج بورتريه يخدع أي شخص تقريباً. تقريباً. ما زالت هناك مواضع قليلة يتصدع فيها الوهم، وحين تعرف أين تنظر ستبدأ برؤيتها في كل مكان.
إليك ما يحدث فعلاً: لماذا تتقن أداة ما رسم البشرة والشعر، ثم تتعثر في يد أو لافتة شارع، وما الذي يقوله ذلك عن طريقة “رؤيتها” للأشياء.
العلامات التي ما زالت تكشف الصورة
بعض العلامات القديمة انتهى زمنها. كانت البشرة البلاستيكية المصقولة واللمعات المتطابقة تماماً في العينين تصرخ: “مزيفة”. النماذج الأحدث تتعامل الآن مع ملمس البشرة وانعكاسات العينين بإقناع، لذلك لم تعد هذه العلامات موثوقة وحدها.
ما الذي ما زال يفلت؟ بضعة مواضع يضطر فيها النموذج إلى إبقاء تفاصيل صغيرة كثيرة متسقة في الوقت نفسه.
| أين تنظر | ما الذي يفضحها | لماذا يحدث ذلك |
|---|---|---|
| الأيدي أثناء الحركة | أصابع زائدة أو ملتحمة عند الإمساك أو التداخل أو حمل شيء | الوضعية معقدة والتفاصيل صغيرة جداً، لذلك تُحسم في النهاية وبأسوأ جودة |
| النص في الخلفية | حروف ذائبة على لافتة بعيدة أو كعب كتاب أو ملصق | يوجّه النموذج جهده إلى العنصر الرئيسي، لا إلى الحروف الصغيرة |
| الانعكاسات والظلال | مرآة تعرض شيئاً خاطئاً، أو ظلال لا تشير إلى مصدر واضح | يرسم انعكاساً يبدو معقولاً، لا انعكاساً صحيحاً فيزيائياً |
| الأنماط المتكررة | صفوف طوب تنحني، أو بلاط يتغير حجمه عبر الصورة | الحفاظ على شبكة منتظمة رياضياً في صورة كاملة أمر صعب |
| المجوهرات والحواف | ساعة تذوب جزئياً في المعصم، أو خاتم يندمج مع الجلد | التقاء سطحين بحد نظيف هو بالضبط الحد الذي يتعثر عنده |
لا شيء من هذه العلامات كاشف سحري. أفضل نماذج 2026 قد تتقن أياً منها. الحيلة أنها نادراً ما تتقنها كلها معاً. قد ترى صورة بأيدٍ مثالية ونص مقروء، ثم تلاحظ أن الضوء يأتي من اتجاهين لا يمكن أن يوجدا معاً.
لماذا تُربك الأيدي والنصوص الذكاء الاصطناعي؟
هذا هو الجزء الذي يفاجئ الناس. النموذج لا يرسم يداً. هو لا يعرف أصلاً أن هناك شيئاً اسمه يد.
وضع بيتر بنتلي، عالم الحاسوب في University College London، الأمر بصراحة في مقابلة مع BBC Science Focus: هذه “مولدات صور ثنائية الأبعاد لا تملك أي تصور على الإطلاق للهندسة ثلاثية الأبعاد لشيء مثل اليد”. هي تتعلم عبر امتصاص ملايين الصور والتقاط الأنماط. اليد غالباً فيها كف، وبعض الأصابع، وبعض الأظافر. لكن كما يقول بنتلي، “لا يفهم أي من هذه النماذج فعلياً ماهية الشيء كاملاً”.
تخيل الأمر أقل كرسام وأكثر كإكمال تلقائي للبكسلات. يتنبأ النموذج بما ينبغي أن يأتي بعد ذلك بناءً على ما رآه، من دون أن يعد إلى خمسة أو يستنتج أي إصبع يذهب إلى أي موضع. اطلب منه يدين بأصابع متشابكة، وبكلمات بنتلي، قد تحصل على “معصمين وكرة من الأصابع”. إنه يخمن شكلاً رآه كثيراً لكنه لم يفهمه حقاً.
وهذا يفسر أيضاً مشكلة بيانات التدريب. في معظم الصور، الأيدي فوضوية. تكون نصف مخفية، أو مقبوضة، أو تلوّح، أو تمسك كوب قهوة، أو مائلة بحيث لا يظهر منها إلا إصبعان. الوجوه تحدق مباشرة في الكاميرا في ملايين اللقطات الواضحة، لذلك ترى النماذج الوجوه من كل زاوية وتحت كل إضاءة. أما الأيدي فتراها غالباً في منتصف الحركة ونصف محجوبة، لذلك تصبح اليد الهادئة، المفتوحة، المواجهة للأمام نادرة بشكل غريب في البيانات. في النهاية يبرع النموذج في الشيء الذي رآه بوضوح، ويتذبذب في الشيء الذي رآه على شكل أجزاء.
النص هو القصة نفسها بزي مختلف. الحروف بالنسبة إلى النموذج أشكال، وليست لغة. يعرف أن اللافتة يجب أن تحمل علامات تشبه الحروف، فيرسم علامات تشبه الحروف. عن قرب، في عنوان بارز، تستطيع النماذج الأحدث التهجئة. ادفعها إلى واجهة متجر بعيدة أو جدار مليء بحروف صغيرة، فتعود إلى خربشات لا تبدو كلمات إلا من آخر الغرفة.
ما الذي أصلحته أحدث النماذج، وما الذي لم تصلحه؟
سيكون من الظلم أن نتظاهر بأن شيئاً لم يتغير. لقد تغير الكثير.
تبدو البشرة حقيقية الآن، بمسام وحبيبات بدلاً من ذلك اللمعان الشمعي. العينان متطابقتان. الوجوه تحمل تعبيرات دقيقة تتجنب جمود الوادي الغريب القديم. النص القصير والبارز يخرج غالباً نظيفاً. الأيدي البسيطة في وضع الراحة، مثل يدين موضوعتين على الحضن، تظهر عادة بشكل جيد. لو رأيت اليوم صورة من أحدث مستوى بلا أي علامات، فلن ترتاب.
ما يقاوم التحسن هو كل ما يحتاج من النموذج إلى فهم قواعد لا مجرد نسخ المظهر. الفيزياء هي المثال الأكبر. الانعكاس يجب أن يطيع الهندسة. الظل يجب أن يتوافق مع الضوء. اليد الملتفة حول كوب يجب أن تعرف أن الكوب أمام بعض الأصابع وخلف بعضها الآخر. هذه ليست مشكلات ملمس، بل مشكلات منطق، ومطابق الأنماط لا يمارس المنطق. يلاحظ بنتلي أن الحل سيكون على الأرجح في التدريب على أشكال ثلاثية الأبعاد حقيقية حتى “تفهم النماذج الشكل خلف الصور”، وهناك أعمال مبكرة في هذا الاتجاه، لكن الأدوات اليومية التي تستخدمها ما زالت ترسم تخمينات مسطحة.
إذا كنت فضولياً لمعرفة إلى أين وصل المجال تحديداً في مشكلة النص، فقد تعمقنا في ذلك في الذكاء الاصطناعي تعلّم أخيراً تهجئة الكلمات داخل الصور. وإذا كنت تريد فقط معرفة الأداة التي تعطي أنظف النتائج اليوم، فقد رتبناها لك في أفضل مولدات الصور بالذكاء الاصطناعي.
كيف تحصل على صور ذكاء اصطناعي لا تبدو مزيفة؟
معرفة سبب تعطل الصور تخبرك بالضبط كيف تتجنبه. أنت تقود النموذج بعيداً عن الأشياء التي يتعثر فيها.
اجعل الأيدي هادئة أو خارج الإطار. إذا لم تكن اليد مضطرة إلى فعل شيء دقيق، فلا تجعلها تفعله. اطلب أيدياً مستريحة، أو في الجيوب، أو اقصّ الصورة بشكل أقرب ببساطة. بورتريه من الصدر إلى أعلى يتجاوز المشكلة كلها.
لا تطلب من الصورة حمل كلماتك. إذا كنت تحتاج إلى عنوان أو شعار أو تعليق، فأضفه لاحقاً في أي أداة تصميم. دع النموذج يصنع الصورة، ثم ضع النص الحقيقي فوقها بنفسك. سيكون حاداً، صحيحاً، وملكك.
صِف الضوء. قل من أين يأتي. عبارة “ضوء نافذة ناعم من اليسار” تعطي النموذج قاعدة يتبعها، فتستقر الظلال والانعكاسات في مكانها بدلاً من أن تشير في اتجاهات عشوائية.
أنشئ، ثم أصلح، ثم أعد الإنشاء. النتيجة الأولى مسودة. التقط العلامة الفاضحة، عدّل الطلب أو ادفع تفصيلاً واحداً، ثم شغّلها من جديد. الأشخاص الذين يحصلون على صور نظيفة ليسوا محظوظين، بل يجرون محاولتين أو ثلاثاً فقط. هنا يفيد العمل في مكان واحد، لأنك تستطيع الإنشاء، ورصد اللافتة الذائبة، وإعادة المحاولة من دون التنقل بين التطبيقات. الفكرة نفسها وراء الكثير من صور المنتجات المصنوعة بالذكاء الاصطناعي: بضع محاولات سريعة، لا طلب واحد مثالي.
تعمّد بعض “النقص”. لقطة فيها قليل من الحبيبات، وغير متمركزة تماماً، وتشعر بأنها حقيقية، تبدو أكثر أصالة من لقطة لامعة. صار هذا أسلوباً بصرياً كاملاً الآن، وقد كتبنا عن سبب أن صور الذكاء الاصطناعي تبدو غير مثالية عن قصد.
الخلاصة الصادقة ليست أن صور الذكاء الاصطناعي سيئة. بل أنها واثقة، والثقة ليست مرادفاً للصواب. اقضِ ثلاثين ثانية في زوايا الإطار وستعرف. ثم حين تصنع صورك، يمكنك توجيه الأداة نحو ما تجيده والالتفاف بهدوء حول الباقي.