Knowledge base

Arabic NLP

Arabic challenges, dialect vs MSA, and OCR for documents.

3 min read

ADIAS: إطار جديد لتصميم الأنظمة الذكية التفاعلية وتفوقه على الأسس الحالية

ADIAS هو إطار عمل جديد لتصميم الأنظمة الذكية التفاعلية، يحقق تحسنًا بنسبة 25% في الأداء مقارنة بالأسس الحالية. يركز على دمج التفاعل البشري مع الذكاء الاصطناعي، مع مراعاة خصوصية اللغة العربية ومتطلبات الامتثال في المنطقة.

4 min read

تحسين خط أنابيب إعادة البناء العصبي باستخدام أدوات NVIDIA Nsight: دليل معرفي للمؤسسات والحكومات في المنطقة العربية

خط أنابيب إعادة البناء العصبي هو سير عمل يعتمد على الشبكات العصبية لتحويل البيانات الطبية الخام (مثل التصوير بالرنين المغناطيسي) إلى نماذج ثلاثية الأبعاد دقيقة. أدوات NVIDIA Nsight، مثل Nsight Systems وNsight Compute، تمكن المطورين من تحليل أداء هذه الخطوط وتحسينها عبر اكتشاف الاختناقات الحسابية وتقليل زمن التنفيذ، مما يعزز كفاءة التطبيقات في المؤسسات الحكومية والخاصة في المنطقة العربية.

3 min read

أفضل ممارسات RAG للمحتوى العربي في المؤسسات

RAG العربي الناجح يبدأ بـ OCR نظيف وتطبيع Unicode (إزالة التشكيل اختيارياً، توحيد الألف/الياء)، chunking 300–500 token مع overlap، hybrid search (BM25 + embeddings)، و reranker. بدون هذه الطبقة، حتى أفضل LLM يهلوس من chunks خاطئة.

3 min read

النماذج متعددة اللغات والعربية: ماذا تختار للمؤسسة؟

النماذج multilingual (GPT-4, Claude, Gemini, Qwen) تدعم العربية ضمن 100+ لغة — مناسبة لمعظم المؤسسات ثنائية اللغة. نماذج Arabic-centric (Jais, ALLaM, AceGPT) قد تتفوق في dialect أو MSA-heavy — الاختيار يعتمد على benchmark على *بياناتكم* لا marketing claims.

2 min read

نماذج التضمين (Embeddings) للغة العربية: دليل اختيار وتقييم

Embedding model يحوّل النص العربي إلى vector رقمي للبحث الدلالي. للـ RAG العربي، جرّبوا نماذج multilingual (مثل multilingual-e5) وArabic-tuned (مثل AraBERT embeddings) على datasetكم — leaderboard عام لا يغني عن recall@5 على مستنداتكم الفعلية.

1 min read

الفصحى أم اللهجة: ماذا يحتاج نظام AI للعربية؟

المستندات الرسمية واللوائح تُكتب بالفصحى (MSA)، لذا أنظمة HR والقانوني والأدوات الداخلية يجب أن تُبنى على MSA. اللهجات قد تفيد في تحليل التعليقات، لكن ليست الأولوية في pilot حكومي/مؤسسي.

1 min read

أفضل ممارسات OCR للمستندات العربية الممسوحة

جودة OCR للعربية تحدد نجاح أي نظام RAG. قبل الفهرسة: استخدم OCR متخصصاً في العربية، راجع عينة 5% يدوياً، وارفض الصفحات under threshold. بدون OCR جيد، حتى أفضل نموذج سيعطي إجابات خاطئة.

1 min read

ما تحديات معالجة اللغة العربية في المؤسسات؟

العربية في AI المؤسسي تواجه: تشكيل وهمزة، RTL، خلط عربي/إنجليزي، لهجات، ومستندات OCR رديئة. الحل ليس نموذجاً أكبر فقط، بل فهرسة وتقسيم (chunking) محسّن للعربية مع اختبار على مستنداتكم الفعلية.