دمجت أمازون إضافة NVRx من إنفيديا في تدريب PyTorch FSDP على Amazon EKS لتحقيق استعادة من أعطال GPU في ثوانٍ وكفاءة تدريب تتجاوز 99% على عناقيد H100 من عقدتين إلى ثماني عقد.

3 دقيقة قراءة

أمازون EKS وNVRx: تدريب موزّع متحمّل للأعطال بكفاءة 99%+

ما الذي حدث؟

نشرت مدونة AWS Machine Learning دليلاً تقنياً لدمج NVIDIA Resiliency Extension (NVRx) في تدريب PyTorch FSDP على Amazon EKS. الهدف هو تقليل أثر أعطال GPU في التدريب الموزّع طويل الأمد، عبر ثلاث آليات: الكتابة غير المتزامنة لنقاط التفتيش، وإعادة التشغيل داخل العملية (in-process restart)، وإعادة التشغيل داخل المهمة عبر ft_launcher.

لماذا يهم هذا؟

في التدريب الموزّع على مئات أو آلاف من وحدات GPU، لا يُعد العطل استثناءً بل حدثاً متوقعاً. الطريقة التقليدية تعني إيقاف المهمة كاملة، وإعادة التحميل من آخر نقطة تفتيش، وإعادة تهيئة الاتصالات بين العقد. هذا يستهلك دقائق ثمينة في كل مرة، ويتكرر عشرات المرات في التدريب الطويل.

NVRx تعالج المشكلة من ثلاث جهات:

  • إخفاء زمن الإدخال/الإخراج: كتابة نقاط التفتيش تتم في الخلفية بالتوازي مع التدريب بدل إيقافه.
  • استعادة في ثوانٍ: إعادة تشغيل العملية المتأثرة دون إنهاء المهمة بالكامل.
  • تقليل فقدان التقدم: العودة إلى أقرب نقطة تفتيش بدل العودة لبداية المرحلة.

الأرقام المعلنة

بحسب المنشور، أظهرت اختبارات على وحدات H100 من عقدتين إلى ثماني عقد:

المقياس النتيجة
كفاءة التدريب تتجاوز 99%
زمن الاستعادة من عطل GPU ثوانٍ
نطاق الاختبار 2 إلى 8 عقد

مقارنة سريعة: الطريقة التقليدية مقابل NVRx

البُعد إعادة التشغيل التقليدية NVRx على EKS
زمن الاستعادة دقائق ثوانٍ
أثر كتابة نقاط التفتيش يوقف التدريب متزامن مع التدريب
نطاق العطل المهمة كاملة العملية المتأثرة
الكفاءة الفعلية تنخفض مع تكرار الأعطال تتجاوز 99% في الاختبارات

حالات استخدام للفرق في المنطقة

  • تدريب النماذج اللغوية العربية: التدريب الطويل على عناقيد مستأجرة يجعل كل دقيقة تعطل خسارة مباشرة.
  • الرؤية الحاسوبية والتصنيف: أحمال التدريب المتكررة تستفيد من تقليل زمن إعادة التهيئة.
  • الجهات الحكومية والمنظّمات: استقرار المهام الطويلة يسهّل الالتزام بجداول التسليم والمراجعة.

ما الذي يجب فعله عملياً؟

  1. التحقق من توافق إصدار PyTorch FSDP مع NVRx في بيئة EKS الحالية.
  2. تهيئة تخزين نقاط التفتيش ليدعم الكتابة غير المتزامنة عالية النطاق الترددي.
  3. اعتماد ft_launcher لإدارة إعادة التشغيل داخل المهمة.
  4. قياس الكفاءة الفعلية قبل وبعد على عنقود اختباري صغير.

الخلاصة

هذا تحديث بنيوي لا إعلان منتج. قيمته الحقيقية تظهر عند التوسع: كلما كبر العنقود وطالت مدة التدريب، زاد العائد من تقليل زمن التعطل. للفرق التي تدرب نماذج كبيرة في المنطقة، هذا مسار يستحق التقييم.

ملاحظة للمراجعة البشرية: الأرقام المذكورة (99%+، ثوانٍ، 2–8 عقد) منقولة عن المنشور الأصلي وتحتاج تحققاً مستقلاً قبل النشر النهائي.

أسئلة شائعة

ما هي NVRx في تدريب الذكاء الاصطناعي؟

NVRx هي اختصار NVIDIA Resiliency Extension، وهي مجموعة أدوات من إنفيديا تُضاف إلى أطر التدريب الموزّع مثل PyTorch FSDP لتحسين تحمّل الأعطال، عبر الكتابة غير المتزامنة لنقاط التفتيش وإعادة التشغيل داخل العملية واستعادة سريعة من أعطال GPU.

كيف يختلف هذا الحل عن إعادة تشغيل المهمة من الصفر؟

في الطريقة التقليدية تُعاد المهمة كاملة من آخر نقطة تفتيش عند أي عطل، ما يهدر وقت العنقود. أما NVRx فتستعيد العملية المتأثرة داخل المهمة نفسها في ثوانٍ، مع إخفاء زمن كتابة نقاط التفتيش خلف التدريب، ما يرفع الكفاءة الفعلية.

هل يستفيد فريق الذكاء الاصطناعي في المنطقة من هذا التحديث؟

نعم، خصوصاً الفرق التي تدرب نماذج لغوية أو رؤية حاسوبية على عناقيد GPU مستأجرة أو سحابية. تقليل زمن التعطل يخفض التكلفة بالساعة ويزيد استغلال العنقود، وهو أمر مهم للجهات التي تعمل بميزانيات محدودة أو مواعيد تسليم صارمة.

ما متطلبات تطبيق NVRx على Amazon EKS؟

يتطلب الأمر تشغيل PyTorch FSDP على EKS مع تكامل NVRx، واستخدام ft_launcher لإدارة إعادة التشغيل داخل المهمة، وتهيئة تخزين نقاط التفتيش بشكل يدعم الكتابة غير المتزامنة. التفاصيل الكاملة في مدونة AWS الرسمية.

المصدر: AWS Machine Learning

محتوى بمساعدة الذكاء الاصطناعي، مراجع بشرياً.