أطلقت مجموعة بحثية منشورة على arXiv مجموعة بيانات OpenDiscoveryTrace التي توثق 558 مساراً كاملاً لوكلاء الذكاء الاصطناعي العلمي، لتكشف أن تقييم النتائج النهائية وحده يخفي فروقاً جوهرية في سلوك النماذج مثل ارتفاع أخطاء Claude Opus 4.6 إلى 30 ضعفاً مقارنة بـGPT-5.4.

2 دقيقة قراءة

OpenDiscoveryTrace: مجموعة بيانات جديدة لتقييم مسار تفكير وكلاء الذكاء الاصطناعي العلمي

ما الجديد في OpenDiscoveryTrace؟

نشرت مجموعة بحثية على arXiv مجموعة بيانات OpenDiscoveryTrace، وهي أول مجموعة عامة واسعة توثق مسار التفكير الكامل لوكلاء الذكاء الاصطناعي العلمي، لا مخرجاتهم النهائية فقط. تضم المجموعة 558 مساراً كاملاً عبر 124 مهمة علمية تشمل اكتشاف الأدوية وعلوم المواد والجينوم وتحليل الأدبيات العلمية.

كيف تُسجَّل المسارات؟

كل خطوة في المسار تُسجَّل عبر 9 حقول منظمة تشمل:

  • الأفكار (Thoughts)
  • استدعاءات الأدوات (Tool Calls)
  • الملاحظات (Observations)
  • الأخطاء (Errors)
  • محفزات المراجعة (Revision Triggers)
  • درجة الثقة الذاتية (Self-reported Confidence)

النماذج المشمولة

الفئة النماذج عدد المسارات
نماذج رائدة GPT-5.4، Claude Opus 4.6، Gemini 3.1 Pro 124 لكل نموذج
نماذج مفتوحة الأوزان Qwen2.5-7B، Mistral-7B-v0.3، Phi-3.5-mini، Qwen2.5-1.5B 30 لكل نموذج
متغيرات الاسترجاع الحي 60 مساراً

النتيجة الأبرز: النجاح المتقارب والفشل المتباين

في تحليل تجريبي شمل 363 مساراً خضعت لتقييم نماذج لغوية، حققت النماذج الرائدة الثلاثة معدلات نجاح متقاربة (84–89%)، لكن المسارات كشفت فروقاً جوهرية:

  • Claude Opus 4.6 أنتج 2.5 خطأ لكل مسار مقابل 0.08 لـGPT-5.4، أي فارق يقارب 30 ضعفاً (p < 0.0001، Cliff's δ = 0.613).
  • 66.7% من أخطاء Claude كانت سوء استخدام أدوات، بينما 83.6% من أخطاء GPT-5.4 كانت أخطاء استدلال.

هذا يعني أن الحكم على النموذج بمعدل نجاحه وحده مضلل؛ فالنموذجان قد يصلان إلى الإجابة الصحيحة بطرق مختلفة تماماً في الموثوقية.

لماذا يهم هذا المنطقة العربية؟

الجهات الحكومية والمؤسسية في المنطقة التي تتبنى وكلاء ذكاء اصطناعي في الصحة أو الطاقة أو البحث العلمي تحتاج إلى تدقيق قابل للتحقق، لا إلى وعود بمعدلات دقة. توفر OpenDiscoveryTrace أساساً لبناء سياسات حوكمة تفرّق بين الاستدلال المنهجي والتخمين المحظوظ، وهو تمييز جوهري قبل أي نشر واسع النطاق.

المهام المعيارية والتوافر

عرّفت الدراسة خمس مهام معيارية مع خطوط أساس من الانحدار اللوجستي والغابات العشوائية وشبكات LSTM والمحولات (Transformers). المجموعة ومخطط التتبع وأدوات التشغيل وتعريفات المهام متاحة علناً بترخيص CC BY 4.0.


ملاحظة للمراجعة البشرية: يستند هذا التقرير إلى الملخص المنشور على arXiv بتاريخ 11 سبتمبر 2026، ولم تخضع الأرقام لتحقق مستقل من طرف ثالث.

أسئلة شائعة

ما هي مجموعة بيانات OpenDiscoveryTrace؟

هي مجموعة بيانات عامة من 558 مساراً كاملاً لوكلاء ذكاء اصطناعي علمي، تسجل خطوات التفكير واستدعاءات الأدوات والأخطاء ودرجات الثقة أثناء تنفيذ 124 مهمة في مجالات علمية متعددة، بدلاً من الاكتفاء بتقييم المخرجات النهائية.

كيف يختلف تقييم المسار عن تقييم المخرجات فقط؟

تقييم المخرجات يقيس النتيجة النهائية فقط، بينما يكشف تقييم المسار كيف وصل النموذج إليها. في هذه الدراسة حققت النماذج الثلاثة الرائدة معدلات نجاح متقاربة، لكن Claude Opus 4.6 ارتكب أخطاءً أكثر بنحو 30 ضعفاً من GPT-5.4، وهو فرق لا يظهر في تقييم المخرجات وحده.

ما الفرق بين أخطاء Claude Opus 4.6 وGPT-5.4؟

غالبية أخطاء Claude Opus 4.6 (66.7%) كانت سوء استخدام للأدوات، بينما كانت 83.6% من أخطاء GPT-5.4 أخطاء استدلال، ما يعني أن لكل نموذج نمط فشل مختلفاً يتطلب معالجة مختلفة.

هل تفيد OpenDiscoveryTrace فرق الذكاء الاصطناعي في المنطقة العربية؟

نعم، فهي توفر إطاراً لتدقيق وكلاء الذكاء الاصطناعي العلمي وقياس موثوقيتهم قبل نشرهم في قطاعات مثل الصحة والطاقة والصناعة، وهو أمر بالغ الأهمية للجهات الحكومية والمؤسسية التي تحتاج إلى حوكمة قابلة للتحقق.

المصدر: arXiv cs.AI

محتوى بمساعدة الذكاء الاصطناعي، مراجع بشرياً.