أطلقت iFLYTEK نموذج iFLYTEK-Embodied-Omni، وهو نموذج أساسي موحد يجمع معالجة الفيديو والصور واللغة والفعل في إطار واحد، مما يتيح للوكلاء المجسّدين فهم التعليمات متعددة الوسائط والتنبؤ بتطور البيئة وتوليد أفعال تحكم دقيقة على مدى زمني طويل، وهو ما يمثل قفزة نوعية في مجال الروبوتات الذكية.

2 دقيقة قراءة

iFLYTEK تطلق نموذجًا موحدًا للوكلاء المجسّدين يجمع الرؤية واللغة والفعل

نظرة عامة

أعلنت iFLYTEK عن إطلاق iFLYTEK-Embodied-Omni، وهو نموذج أساسي موحد للوكلاء المجسّدين (Embodied Agents) يجمع بين معالجة الفيديو والصور واللغة والفعل في إطار واحد. يهدف النموذج إلى تمكين الروبوتات من فهم التعليمات متعددة الوسائط، والتنبؤ بتطور البيئة، وتوليد أفعال تحكم دقيقة على مدى زمني طويل.

آلية العمل: تعاون الدماغ والمخيخ

يعتمد النموذج على بنية مبتكرة تحاكي التعاون بين الدماغ والمخيخ:

  • الدماغ (Brain): يتكون من نموذج الرؤية واللغة (VLM) ونموذج توليد الفيديو (VGM)، وهو مسؤول عن فهم التعليمات والتخطيط للمهام وتتبع التقدم والتنبؤ بالحالات البصرية المستقبلية.
  • المخيخ (Cerebellum): يتكون من نموذج توليد الأفعال (AGM)، وهو مسؤول عن تحويل الأهداف الفرعية المخطط لها والسياق متعدد الوسائط إلى أفعال قابلة للتنفيذ.

البيانات والتدريب

تم تدريب النموذج على مجموعة بيانات شاملة تجمع بين:

  • فيديوهات بشرية مع تعليقات أفعال
  • فيديوهات تفاعلات روبوتية بدون تعليقات
  • بيانات استدلال مجسد
  • بيانات إدراك مجسد
  • بيانات صور ونصوص عامة

واعتمدت iFLYTEK استراتيجية تدريب من أربع مراحل:

  1. تدريب نموذج الرؤية واللغة (VLM)
  2. تدريب نموذج توليد الفيديو (VGM)
  3. تدريب نموذج توليد الأفعال (AGM)
  4. الضبط المشترك للنموذج الكامل

الأهمية للشرق الأوسط

يمثل هذا النموذج خطوة مهمة نحو تطوير روبوتات ذكية قادرة على العمل في بيئات معقدة مثل المصانع والمستشفيات والمزارع في منطقة الشرق الأوسط. يمكن للروبوتات المجسّدة المزودة بهذا النموذج فهم التعليمات باللغة العربية والتفاعل مع البيئات المحلية بكفاءة عالية.

مقارنة مع الحلول الحالية

الميزة iFLYTEK-Embodied-Omni الأنظمة المتتالية
التكامل موحد منفصل
أخطاء التجميع منخفضة عالية
سرعة الاستجابة عالية متوسطة
فهم متعدد الوسائط نعم محدود

ملاحظة: هذا الخبر يستند إلى ورقة تقنية من arXiv ويحتاج إلى مراجعة بشرية للتحقق من التفاصيل والبيانات.

أسئلة شائعة

ما هو iFLYTEK-Embodied-Omni؟

هو نموذج أساسي موحد للوكلاء المجسّدين يجمع معالجة الفيديو والصور واللغة والفعل في إطار واحد، مما يمكن الروبوتات من فهم التعليمات متعددة الوسائط والتنبؤ بالبيئة وتوليد أفعال دقيقة.

كيف يختلف هذا النموذج عن الحلول الحالية؟

على عكس الأنظمة المتتالية التي تفصل بين فهم اللغة والرؤية وتوليد الفيديو ثم الأفعال، يدمج iFLYTEK-Embodied-Omni كل هذه القدرات في نموذج واحد مع اتصال متبادل عبر الانتباه الذاتي متعدد الوسائط، مما يقلل من أخطاء التجميع.

هل يمكن استخدام هذا النموذج في تطبيقات الشرق الأوسط؟

نعم، يمكن استخدامه في تطبيقات مثل الروبوتات الصناعية والخدمية والرعاية الصحية والزراعة الذكية، حيث يحتاج الوكلاء إلى فهم التعليمات باللغة العربية والتفاعل مع البيئات المحلية.

المصدر: arXiv cs.AI

محتوى بمساعدة الذكاء الاصطناعي، مراجع بشرياً.