أطلق باحثو الحوسبة الفائقة إطار REDI المفتوح المصدر لأتمتة تحويل البيانات العلمية الضخمة إلى صالحة للتدريب على الذكاء الاصطناعي، مما يقلص وقت التحضير من أسابيع إلى ساعات ويدعم التوسع إلى 100 عقدة على حاسوب Frontier الفائق.

2 دقيقة قراءة

إطار عمل مفتوح المصدر REDI لأتمتة جاهزية البيانات العلمية للذكاء الاصطناعي

نظرة عامة على REDI

أعلن باحثو مرافق الحوسبة القيادية عن إطلاق إطار عمل مفتوح المصدر جديد باسم REDI (Readiness for Experimental Data and AI) لأتمتة تحويل البيانات العلمية الضخمة إلى صالحة للتدريب على نماذج الذكاء الاصطناعي. يعالج الإطار فجوة رئيسية في سير العمل العلمي، حيث لا يوجد إطار حالي يوحد الأتمتة الكاملة وتقييم الجاهزية وتتبع المصدر والنشر كأداة قابلة للاستدعاء من قبل وكلاء ذكاء اصطناعي.

المراحل الخمس لـ REDI

يتكون REDI من خمس مراحل متكاملة:

  1. الاستيعاب (Ingest): استيراد البيانات من مصادر متنوعة.
  2. المعالجة المسبقة (Preprocess): تنظيف البيانات وإزالة التشويش.
  3. التحويل (Transform): تحويل التنسيقات والهياكل.
  4. الهيكلة (Structure): تنظيم البيانات في هياكل قابلة للتدريب.
  5. الإخراج (Output): تصدير البيانات الجاهزة مع التوثيق الكامل.

كل مرحلة مزودة بأدوات قياس لإعادة الإنتاجية والنشر كأداة قابلة للاستدعاء من قبل وكلاء ذكاء اصطناعي.

التقييم عبر المجالات العلمية

تم اختبار REDI في أربعة مجالات علمية:

  • نمذجة المناخ: تحويل بيانات محاكاة المناخ الضخمة.
  • البروتيوميات: تحويل بيانات تسلسل البروتينات.
  • علوم المواد: تحويل بيانات خصائص المواد.
  • الاندماج النووي: تحويل بيانات تجارب الاندماج.

أظهرت النتائج تحويل جميع البيانات من الحالة الخام إلى الجاهزة للذكاء الاصطناعي، مع التحقق من صحة المخرجات مقابل مراجع خبراء المجال.

الأداء والتوسع

أظهرت النتائج الأولية أداءً متوازياً شبه مثالي عند التوسع إلى 100 عقدة على حاسوب Frontier الفائق في حالة المناخ. كشف التحليل المزود بتتبع المصدر أن الإدخال/الإخراج للملفات هو التكلفة المهيمنة في خط الأنابيب، مع كون اختيار التنسيق أداة تحسين من الدرجة الأولى.

أداة SetGo للامتثال لـ FAIR

تتضمن الحزمة أداة مرافقة باسم SetGo تؤتمت الامتثال لمبادئ FAIR (قابلية البحث، الوصول، التشغيل البيني، وإعادة الاستخدام) ونشر البيانات في الكتالوجات العلمية.

الأهمية للشرق الأوسط

يمكن لمؤسسات البحث والجامعات في الشرق الأوسط، خاصة تلك العاملة في مجالات المناخ والطاقة والمواد، استخدام REDI لأتمتة تحضير البيانات، مما يقلص وقت التحضير من أسابيع إلى ساعات ويسهل التعاون عبر التخصصات. كما أن الطبيعة مفتوحة المصدر تسمح بالتخصيص وفق الاحتياجات المحلية.

ملاحظة للمراجعة البشرية: تم تلخيص المعلومات من الورقة البحثية بدقة، مع إضافة سياق إقليمي للشرق الأوسط.

أسئلة شائعة

ما هو إطار REDI؟

REDI هو إطار عمل مفتوح المصدر لأتمتة تحويل البيانات العلمية الضخمة إلى صالحة للتدريب على نماذج الذكاء الاصطناعي، عبر خمس مراحل مع تتبع مصدر البيانات وإمكانية النشر كأداة قابلة للاستدعاء من قبل وكلاء ذكاء اصطناعي.

ما هي المجالات التي تم اختبار REDI فيها؟

تم اختبار REDI في أربعة مجالات علمية: نمذجة المناخ، البروتيوميات، علوم المواد، والاندماج النووي، وأظهر تحويل جميع البيانات من الحالة الخام إلى الجاهزة للذكاء الاصطناعي.

كيف يساهم REDI في تسريع البحث العلمي في الشرق الأوسط؟

يمكن لمؤسسات البحث في الشرق الأوسط استخدام REDI لأتمتة تحضير البيانات من مجالات مثل المناخ والطاقة، مما يقلص وقت التحضير من أسابيع إلى ساعات ويسهل التعاون عبر التخصصات.

ما هي أداة SetGo المرافقة لـ REDI؟

SetGo هي أداة مرافقة لـ REDI تؤتمت الامتثال لمبادئ FAIR (قابلية البحث، الوصول، التشغيل البيني، وإعادة الاستخدام) ونشر البيانات في الكتالوجات العلمية.

المصدر: arXiv cs.AI

محتوى بمساعدة الذكاء الاصطناعي، مراجع بشرياً.