أعلنت NVIDIA عن تحسينات جديدة في Transformer Engine لتسريع تدريب نماذج Mixture of Experts (MoE) في إطار JAX دون إسقاط الرموز (dropless)، ما يقلل تكلفة التدريب ويرفع كفاءة الاستفادة من وحدات GPU.

2 دقيقة قراءة

NVIDIA تطلق تحسينات تدريب MoE في JAX عبر Transformer Engine

ما الذي أعلنته NVIDIA؟

كشفت NVIDIA عن تحسينات جديدة في Transformer Engine لتسريع تدريب نماذج Mixture of Experts (MoE) داخل إطار JAX بنمط dropless، أي دون إسقاط الرموز التي تتجاوز سعة الخبراء. يأتي ذلك ضمن اتجاه متصاعد تعتمده نماذج مثل DeepSeek وQwen وMixtral، التي تحقق أداءً يقارب النماذج الكثيفة بجزء من تكلفة التدريب.

لماذا يهم هذا الخبر؟

تعتمد نماذج MoE على الحوسبة الشرطية، إذ تُفعّل شبكة تغذية أمامية فرعية (FFN) لكل رمز بدلاً من تشغيل الشبكة الكاملة. هذا يخفض تكلفة التدريب والاستدلال، لكنه يفرض تحديات في توزيع الأحمال بين الخبراء. النمط dropless يحافظ على جميع الرموز، ما يمنع فقدان التدرجات ويحسّن جودة النموذج النهائي.

مقارنة سريعة

المعيار MoE تقليدي MoE بنمط dropless
التعامل مع الرموز الزائدة إسقاطها الاحتفاظ بها
جودة التدرجات أقل أعلى
استهلاك الذاكرة أقل أعلى نسبياً
كفاءة التدريب جيدة أفضل مع تحسينات NVIDIA

الأثر على المنطقة

بالنسبة لفرق الذكاء الاصطناعي في الشرق الأوسط، تعني هذه التحسينات إمكانية تدريب نماذج عربية متعددة الخبراء على نفس عتاد GPU بكفاءة أعلى، ما يقلل تكاليف السحابة ويسرّع دورة التطوير. كما يفيد المؤسسات التي تبني نماذج قطاعية (حكومية، مالية، صحية) بأحجام معقولة.

خلاصة

تمثل تحسينات NVIDIA خطوة عملية في سباق كفاءة تدريب MoE، وتضع JAX في موقع أقوى أمام PyTorch لمن يبحث عن أداء عالٍ بأقل تكلفة حوسبة.

ملاحظة للمراجعة البشرية: يُرجى التحقق من تفاصيل الإصدار الرسمي وأرقام الأداء قبل النشر.

أسئلة شائعة

ما هو تدريب MoE بنمط dropless؟

هو أسلوب تدريب نماذج Mixture of Experts يمنع إسقاط الرموز التي تتجاوز سعة الخبراء، ما يحافظ على جميع التدرجات ويحسّن جودة النموذج مقارنة بالطرق التقليدية التي تُهمل الرموز الزائدة.

كيف تستفيد فرق الذكاء الاصطناعي في الشرق الأوسط من هذه التحسينات؟

تتيح التحسينات تدريب نماذج MoE بكفاءة أعلى على نفس عتاد GPU، ما يقلل تكاليف السحابة وزمن التدريب ويسهّل بناء نماذج عربية متعددة الخبراء.

هل هذه التحسينات متاحة لجميع أطر العمل؟

التحسينات موجهة لإطار JAX عبر NVIDIA Transformer Engine، وهي جزء من منظومة NVIDIA المفتوحة التي تدعم أيضاً PyTorch وMegatron.

ما الفرق بين MoE والنماذج الكثيفة؟

MoE يستخدم حوسبة شرطية تُفعّل جزءاً من الخبراء فقط لكل رمز، ما يخفض تكلفة التدريب والاستدلال مع الحفاظ على أداء يقارب النماذج الكثيفة.

المصدر: NVIDIA Developer (AI)

محتوى بمساعدة الذكاء الاصطناعي، مراجع بشرياً.