سرقة سلاسل التفكير المشفرة من نماذج الذكاء الاصطناعي الرائدة: ثغرة خطيرة كشفت أسرار GPT-5.6 وClaude
نظرة عامة على الثغرة
كشف بحث جديد بعنوان "سرقة سلاسل التفكير من واجهات برمجة تطبيقات النماذج الخاصة" عن ثغرة أمنية خطيرة في نماذج الذكاء الاصطناعي الرائدة من OpenAI وAnthropic وGoogle. تسمح الثغرة للباحثين باستخراج سلاسل التفكير المشفرة التي تولدها هذه النماذج، والتي تحتوي على عمليات التفكير الداخلية، عبر إعادة تشغيلها على نماذج أضعف في نفس العائلة.
كيف تعمل الثغرة؟
أظهر الباحثون أن النماذج من نفس العائلة تستخدم نفس مفتاح التشفير، مما يسمح بإعادة تشغيل الكتل المشفرة على نماذج أصغر وأضعف. ثم يتم اختراق النموذج الأضعف عبر تقنيات "jailbreaking" لإجباره على إخراج النص الأصلي غير المشفر. على سبيل المثال، كان نموذج Claude Haiku 4.5 الأسهل للاختراق باستخدام برومبت معين.
أمثلة على السلاسل المستخرجة
كشف البحث عن سلاسل تفكير لم تكن مخصصة للاستهلاك البشري، مثل تفكير GPT-5.5 في مشكلة CSS، مما يوضح طبيعة هذه البيانات الحساسة.
هجمات الحقن السريع المتقدمة
كما كشف البحث عن نوع جديد من هجمات الحقن السريع، حيث يتم خداع النموذج للتفكير في استخراج البيانات كجزء من سلسلة تفكيره، ثم يتم إعادة تغذية هذه السلسلة إلى نموذج آخر، مما يزيد من احتمالية تنفيذ التعليمات الضارة.
الإصلاح والدروس المستفادة
أكدت جميع المزودين إصلاح الثغرة، لكن هذا البحث يسلط الضوء على أهمية فهم حدود نماذج الذكاء الاصطناعي وتطبيق ممارسات أمان صارمة في المؤسسات، خاصة في الشرق الأوسط حيث يزداد الاعتماد على هذه التقنيات.
ملاحظة للمراجعة البشرية: هذا المقال يعتمد على ملخص البحث الأصلي، ويُنصح بالرجوع إلى الورقة الكاملة للتفاصيل الدقيقة.
أسئلة شائعة
ما هي ثغرة سرقة سلاسل التفكير؟
هي ثغرة أمنية تسمح للباحثين باستخراج سلاسل التفكير المشفرة من نماذج الذكاء الاصطناعي الرائدة، مثل GPT-5.6 وClaude، عبر إعادة تشغيلها على نماذج أضعف في نفس العائلة.
كيف تؤثر هذه الثغرة على المؤسسات في الشرق الأوسط؟
قد تعرض البيانات الحساسة للخطر إذا كانت النماذج تستخدم في معالجة معلومات سرية، وتستدعي مراجعة إجراءات الأمان والاعتماد على مزودين موثوقين.
هل تم إصلاح الثغرة؟
نعم، أكدت جميع المزودين (OpenAI وAnthropic وGoogle) استلام التقرير وتم إصلاح الثغرة، لكن لا يزال هناك حاجة لليقظة.
ما هي الدروس المستفادة من هذه الثغرة؟
ضرورة فهم حدود نماذج الذكاء الاصطناعي، وتطبيق ممارسات أمان صارمة، ومراقبة التحديثات الأمنية من المزودين.
المصدر: Simon Willison (LLM & tools)
محتوى بمساعدة الذكاء الاصطناعي، مراجع بشرياً.