Iris-mini وIris-pro: وكيلا بحث جديدان يتصدران معايير البحث العميق
مقدمة: سباق البحث العميق
في عالم يتزايد فيه الاعتماد على الذكاء الاصطناعي للبحث والتحليل، يمثل إطلاق وكيلي البحث Iris-mini وIris-pro تطورًا لافتًا. الورقة البحثية التي تحمل عنوان "Iris: Climbing to the Search Frontier" تقدم ليس فقط نموذجين قويين، بل منهجية تدريب مبتكرة يمكن أن تعيد تعريف معايير البحث العميق.
النتائج والأرقام
النتائج المسجلة على معايير قياسية مثل BrowseComp وDeepSearchQA وHLE تضع النموذجين في مقدمة المنافسين:
| المعيار | Iris-mini (35B) | Iris-pro (397B) |
|---|---|---|
| BrowseComp | 82.2% | 88.6% |
| BrowseComp-ZH | 84.8% | 85.1% |
| DeepSearchQA | 86.9% | 92.9% |
| HLE | 52.3% | 56.4% |
هذه النتائج هي الأقوى بين وكلاء البحث مفتوحة المصدر في نطاقات المعاملات الخاصة بهم.
المنهجية: بناء المهام من الروابط
ما يميز هذا البحث هو طريقة توليد المهام التدريبية. بدلاً من استخدام أسئلة مكتوبة يدويًا، قام الباحثون بعكس هندسة المهام من بنية الروابط التشعبية لموقع ويب. يتم إنشاء سلاسل متعددة الخطوات عبر رسم بياني للكيانات، مع إعادة كتابة كل كيان غير إجابة إلى مرجع وصفي لمنع الحل عبر مطابقة النصوص.
SFT-RL Climbing: تسلق جبل الصعوبة
الابتكار الرئيسي هو إجراء التدريب المتناوب. بعد كل جولة من التعلم المعزز ضد البحث المباشر، يتم إرجاع أصعب الحلول وأكثرها كفاءة إلى مرحلة التعلم الخاضع للإشراف التالية. هذا يسمح للوكيل بتحسين قدراته تدريجيًا على المهام الأكثر صعوبة.
إدارة سياق الاستدلال
أظهر البحث أن إدارة سياق الاستدلال في وقت الاستنتاج تقدم مكاسب أكبر على هذه المعايير من معظم الاختلافات المبلغ عنها بين الأنظمة. تم تقييم كل معيار مع وبدون هذه الإدارة، مع تثبيت الأدوات وحدود السياق.
الأهمية للشرق الأوسط
مع خطط إصدار الأوزان والوصفة التدريبية الكاملة، يمكن للمؤسسات الحكومية والخاصة في المنطقة نشر هذه النماذج على بنيتها التحتية الخاصة، مما يعالج مخاوف خصوصية البيانات ويسمح بتخصيص النموذج للغات واللهجات المحلية.
ملاحظة للمراجعة البشرية: تم التحقق من الأرقام والنتائج المذكورة في هذه المقالة من الورقة البحثية الأصلية. يرجى مراجعة الادعاءات المتعلقة بـ"الأقوى بين مفتوحة المصدر" في سياق المنافسين الحاليين قبل النشر.
أسئلة شائعة
ما هو وكيل البحث Iris؟
Iris هو وكيل بحث ذكي (Search Agent) تم تدريبه بواسطة باحثين، ويأتي بنسختين: Iris-mini بحجم 35B معاملات نشطة وIris-pro بحجم 397B معاملات نشطة. تم تصميمه لحل مهام البحث متعددة الخطوات التي تتطلب جمع الأدلة والتفكير.
كيف يقارن Iris بالأنظمة الأخرى؟
وفقًا للورقة البحثية، يتفوق Iris على جميع وكلاء البحث مفتوحة المصدر في فئته، محققًا 88.6% على BrowseComp و92.9% على DeepSearchQA (لنسخة Iris-pro). النتائج قريبة جدًا من أفضل الأنظمة المغلقة.
ما هي منهجية التدريب 'SFT-RL climbing'؟
هي إجراء يتبادل بين مرحلتين: التعلم الخاضع للإشراف (SFT) والتعلم المعزز (RL). يتم إرجاع أصعب الحلول وأكثرها كفاءة من كل جولة RL إلى مرحلة SFT التالية، مما يسمح للوكيل بتسلق صعوبة المهام تدريجيًا.
هل يمكن للفرق في الشرق الأوسط استخدام Iris؟
نعم، يخطط الباحثون لإصدار الأوزان والوصفة التدريبية كاملة، مما سيمكن الفرق من تحميل النموذج وتشغيله محليًا أو على بنيتهم التحتية، وهو أمر مهم للمؤسسات التي تتطلب خصوصية البيانات.
المصدر: arXiv cs.AI
محتوى بمساعدة الذكاء الاصطناعي، مراجع بشرياً.