مقارنة النماذج مقارنة نماذج الصور أدوات الذكاء الاصطناعي النماذج نماذج الصور أخبار الذكاء الاصطناعي البحث جرّب مجانًا
توضيح 6 دقائق للقراءة

ما هو الذكاء الاصطناعي متعدد الوسائط؟ (بلغة مبسطة)

بقلم Chatday Editorial Team ·

aiexplainermultimodalhow-it-works
ما هو الذكاء الاصطناعي متعدد الوسائط؟ (بلغة مبسطة)

قبل وقت ليس بعيدًا، كان استخدام الذكاء الاصطناعي يعني كتابة نص وانتظار نص في الرد. كان بمثابة صديق مراسلة بالغ الذكاء. ثم تغيّر شيء ما، وأصبح بإمكانك اليوم أن تُريه صورة، أو تتحدث إليه بصوتك، أو تطلب منه أن يرسم لك لوحة. لهذا التحول اسم يبدو أكثر تعقيدًا من واقعه: الذكاء الاصطناعي متعدد الوسائط.

إذا نزعنا عنه المصطلحات التقنية، فهو يعني ببساطة ذكاءً اصطناعيًا يتعامل مع أكثر من نوع واحد من المعلومات؛ الكلمات نعم، ولكن أيضًا الصور والصوت والفيديو. الفرق هنا يشبه الفرق بين مساعد لا يقرأ سوى الرسائل التي تمرّرها له من تحت الباب، ومساعد يستطيع فعليًا أن ينظر ويسمع ويتحدث. وفيما يلي ما يعنيه ذلك لك، بلغة مبسطة.

ما الذي تعنيه «الوسائط» فعليًا

«الوسيلة» هي مجرد نوع من المعلومات؛ النص وسيلة، والصورة وسيلة أخرى، وصوتك وسيلة ثالثة، والفيديو وسيلة رابعة. كان الذكاء الاصطناعي القديم أحادي الوسيلة: نص يدخل، نص يخرج. أما الذكاء الاصطناعي متعدد الوسائط فيستطيع استقبال عدة أنواع منها في الوقت نفسه والعمل عليها معًا.

تخيّل الأمر من منظور الإنسان؛ فأنت لا تقرأ فقط، بل تنظر إلى خريطة، وتستمع إلى توجيهات، وتشاهد من يشرح لك أمرًا، وتردّ بالكلام. الذكاء الاصطناعي متعدد الوسائط هو محاولة لإعطاء البرمجيات هذا المزيج نفسه من الحواس، حتى تتمكن من التواصل معه بالطريقة الطبيعية التي تعتادها، لا بالكتابة فقط.

ما يمكنك فعله به بالفعل

هنا تبدأ المتعة، لأن استخداماته اليومية عملية بحق:

  • صوّر واسأل. التقط صورة لما بداخل ثلاجتك واسأل «ماذا يمكنني أن أطبخ بهذا؟»، أو صورة نبتة، أو طفح جلدي، أو ضوء تحذير غريب في لوحة القيادة، أو مسألة رياضية في كتاب مدرسي.
  • ترجم العالم من حولك. التقط صورة لقائمة طعام أو لوحة بلغة أخرى واحصل على ترجمتها فورًا.
  • تحدّث بدل الكتابة. أجرِ حوارًا صوتيًا متبادلًا دون استخدام يديك، كأنها محادثة حقيقية.
  • حوّل الكلمات إلى صور. صف الصورة التي تريدها ودع الذكاء الاصطناعي يُنشئها، وهذا عالم إبداعي كامل بذاته، تناولناه في مقالنا عن أفضل مولّدات الصور بالذكاء الاصطناعي.
  • افهم لقطة شاشة. ألصق رسالة خطأ محيّرة أو رسمًا بيانيًا واسأل عن معناها.

الخيط المشترك بين كل هذا: لم تعد مضطرًا لوصف الأشياء بالكلمات فقط، بل يمكنك أن تُريها للذكاء الاصطناعي مباشرة.

الوسائط، وما تفتحه من إمكانيات

وهذا ملخص سريع لما يشمله مصطلح «متعدد الوسائط»، ولماذا كل وسيلة منها مفيدة.

الوسيلةما تعنيهمفيدة في
النصالقراءة والكتابةالأسئلة، الصياغة، التلخيص
الصورة (إدخال)فهم صورة تعرضها عليه«ما هذا؟»، ترجمة اللوحات، قراءة لقطات الشاشة
الصورة (إخراج)إنشاء صورة من الكلماتالأعمال الفنية، النماذج التصميمية، منشورات التواصل الاجتماعي
الصوتالاستماع والتحدثالدردشة دون استخدام اليدين، التفريغ النصي، الملاحظات الصوتية
الفيديوفهم اللقطات المتحركةشرح مقطع فيديو، تلخيص ما حدث فيه

لا يدعم كل نموذج جميع الوسائط، وبعضها أفضل في وسيلة معينة من غيرها، لكن الاتجاه واضح: النماذج الأفضل تدعم اليوم معظم هذه الوسائط بشكل مباشر وبصورة متزايدة.

لماذا هو أهم مما يبدو

تعدد الوسائط ليس مجرد خدعة استعراضية، بل يغيّر من يستفيد فعليًا من الذكاء الاصطناعي. كتابة طلب مفصّل تتطلب مهارة وقد تكون حاجزًا أمام كثيرين، أما توجيه هاتفك نحو شيء ما فلا يتطلب أي مهارة. طفل، أو جدّ، أو شخص مستعجل؛ أي إنسان يستطيع أن يرفع صورة ويطرح سؤالًا.

كما أن هذا يجعل الذكاء الاصطناعي أكثر فائدة، لأن مزيدًا من السياق يعني إجابات أدق. فوصف المشكلة له أمر، وأما إظهارها كما هي فأكثر دقة بكثير. وهذه القدرة على استيعاب صورة أشمل والاستدلال عليها ترتبط بالتحوّل الأوسع في كيفية تفكير الذكاء الاصطناعي الحديث قبل أن يجيب.

أين يقصّر الذكاء الاصطناعي متعدد الوسائط

إنه مثير للإعجاب، لكنه ليس معصومًا من الخطأ. قد يخطئ الذكاء الاصطناعي في قراءة صورة غير واضحة، أو يسمع كلمة خطأ في غرفة مزدحمة بالضجيج، أو يحدّد شيئًا بثقة رغم خطئه. قد يقرأ إجماليًا مكتوبًا بخط اليد بشكل غير صحيح، أو يترجم عبارة معقّدة على لوحة ما بطريقة خاطئة.

والقاعدة نفسها كما كانت دائمًا: رائع للمساعدة اليومية منخفضة المخاطر، لكن تحقّق من كل ما هو مهم. فإذا ترجم ملصق دواء، أو إشعارًا قانونيًا، أو فاتورة مطعم، تأكّد بنفسك قبل أن تعتمد عليه. تعامل مع عينيه وأذنيه بصفتهما جيدتين جدًا لا كاملتين. تريد أن ترى كيف تتعامل نماذج مختلفة مع الصورة أو السؤال نفسه؟ قارن بينها في أداة مقارنة النماذج.

هو ذكاء اصطناعي يعمل مع أكثر من نوع واحد من المعلومات، ليس النص فقط بل أيضًا الصور والصوت والفيديو. وعمليًا يعني ذلك أنك تستطيع أن تُريه صورة، أو تتحدث إليه، أو تطلب منه إنشاء صورة، بدلًا من الكتابة فقط.
أرِه صورة واسأله عن محتواها، أو ترجم لوحة أو قائمة طعام بتوجيه كاميرتك نحوها، أو أجرِ محادثة صوتية، أو اطلب شرح لقطة شاشة أو رسالة خطأ، أو أنشئ صورة من وصف نصي.
معظم النماذج الرائدة كذلك، على الأقل بالنسبة للنص والصور، بينما ينتشر دعم الصوت والفيديو أكثر فأكثر. وتختلف القدرات من نموذج لآخر، فبعضها يتعامل مع وسائط معينة بشكل أفضل من غيرها.
إنه مفيد جدًا لكنه غير مثالي. قد يخطئ في قراءة صورة غير واضحة أو في سماع كلام، فتحقّق من كل ما هو مهم، مثل ملصق مُترجَم أو فاتورة أو تفصيل طبي، قبل الاعتماد عليه.
إنه يُلغي الحاجة إلى وصف كل شيء بالكلمات. فأي شخص يمكنه توجيه هاتفه وطرح سؤاله، وهذا يجعل الذكاء الاصطناعي أكثر سهولة في الوصول إليه بكثير، وعادةً ما يمنحك إظهار الشيء الحقيقي إجابة أدق.

الخلاصة

الذكاء الاصطناعي متعدد الوسائط هو ببساطة ذكاء اصطناعي اكتسب حواسًا. يستطيع أن ينظر إلى ما تعرضه عليه، ويستمع إلى ما تقوله، ويردّ بالكلمات أو بالصور. وهذا يحوّله من مجرد صندوق نص تصف له الأشياء، إلى مساعد يكفي أن توجّهه نحو العالم من حولك. وأسهل طريقة لفهمه هي تجربته: أعطه صورة واطرح سؤالًا.