logo
تكنولوجيا

ابتكارات رقمية تدعم الذكاء الاصطناعي لفهم اللغة العربية

ابتكارات رقمية تدعم الذكاء الاصطناعي لفهم اللغة العربية
البرمجيات الجديدة ستعتمد على التقنيات المعززة بالذكاء الاصطناعيالمصدر: wallispr
تاريخ النشر:

في سباق تطوير تقنيات الذكاء الاصطناعي باللغة العربية، يتجه الباحثون بشكل متزايد إلى استخدام «البيانات الاصطناعية» (Synthetic Datasets) لتعويض النقص الواضح في الموارد اللغوية الطبيعية.

ورغم التحديات المرتبطة بهذا النهج، يرى خبراء أن هذه المقاربة تمثل حلاً عملياً في ظل محدودية توفر البيانات باللغة العربية، وفقاً لتقرير نشره موقع AGBI.

أخبار ذات صلة

شاشة شفافة تقوم بالترجمة الفورية للزوار خلال معرض تقني عالمي بالصين.

اللغة العربية لم تعد عقبة… كيف يمكّن الذكاء الاصطناعي نمو الشركات؟

ولا تعني «البيانات الاصطناعية» بالضرورة معلومات مُنشأة من العدم؛ بل غالباً ما يتم جمعها وتنقيتها من مصادر متنوعة، أو توسيع مجموعات بيانات صغيرة تُعرف بـ«البذور» باستخدام نماذج الذكاء الاصطناعي.

وعلى خلاف «البيانات الطبيعية» (Natural Data) المستمدة من المقالات الإخبارية أو منشورات التواصل الاجتماعي أو سجلات الشركات أو بيانات الطقس، تُبنى «البيانات الاصطناعية» بواسطة نماذج اللغة الكبيرة (LLMs) لمحاكاة أنماط العالم الواقعي بدقة.

وقالت عالمة البيانات المقيمة في لندن، فانيا لييفار، لـAGBI: «مصطلح 'اصطناعية' قد يكون مضللاً؛ فهي ليست من نسج الخيال. يتم تدريب النماذج على تقليد التوزيعات والأنماط الواقعية، أو يُستخدم وكلاء آليون لمحاكاة سلوكيات معينة، أو يتم توسيع مجموعات صغيرة إلى نطاق أوسع».

وأضافت: «عندما يتعلم الذكاء الاصطناعي من أنماط وارتباطات حقيقية، فإنه يولّد بيانات جديدة تبدو وتتصرف كما لو كانت حقيقية».

سد فجوة البيانات العربية

أحد أبرز مزايا «البيانات الاصطناعية» هو قدرتها على معالجة النقص الكبير في البيانات العربية. فقد استعان باحثو «معهد الابتكار التكنولوجي» في الإمارات بهذه التقنية عند تطوير نموذج اللغة الكبير «فالكون» (Falcon) لتدريب الذكاء الاصطناعي على فهم اللهجات العربية.

وشرح الباحث الرئيس في المعهد، حكيم حسيد: «بدأنا من مجموعة بيانات محدودة للهجات مثل اللهجة الإماراتية، ثم بنينا نموذجاً صغيراً قادراً على توليد بيانات إضافية انطلاقاً من هذه النواة».

كما خاضت فرق أكاديمية تجارب مماثلة. ففي مايو 2025، نشرت «جامعة الأمير سلطان» في السعودية بالتعاون مع «جامعة محمد بن زايد للذكاء الاصطناعي» في الإمارات دراسة حول استخدام البيانات الاصطناعية لتحسين أنظمة تقييم المقالات العربية. ولّد المشروع أكثر من 3,000 مقال باستخدام الذكاء الاصطناعي، ثم أُدخلت تعديلات يدوية لإضافة أخطاء متعمدة، ما أسهم في رفع كفاءة أنظمة التقييم الآلي.

وفي مشروع آخر، أنشأ فريق بحثي مجموعة بيانات اصطناعية تضم أكثر من 840 ألف وثيقة و690 مليون كلمة مكتوبة بأنماط خط متنوعة لتدريب النماذج على التعرف إلى الحروف العربية. وأوضح الباحثون أن هذه البيانات تتميز بأنها «خالية من التشويش والضوضاء الواقعية، وتوفر بيئة نظيفة ومضبوطة لتدريب النماذج».

أخبار ذات صلة

«انتيلا» تغلق جولة تمويلية (Series-A) بقيمة 12.5 مليون دولار بقيادة (Prosus)، للتوسع في تقديم تقنيات الذكاء الاصطناعي باللغة العربية.

«انتيلا» المتخصصة بالذكاء الاصطناعي تغلق جولة تمويل بـ12.5مليون دولار

بين الفرص والمخاطر

تتمثل الميزة الأساسية لـ«البيانات الاصطناعية» في قدرتها على توليد كميات ضخمة من البيانات النظيفة والموحدة، ما يوفر بيئة مثالية لتدريب النماذج. وقال جلال كفوقلو من شركة التحليلات «ساس» (SAS): «البيانات الاصطناعية تمنحنا طريقة مضبوطة لإنتاج مواد تدريبية قابلة للاستخدام».

لكن هذه التقنية ليست خالية من التحديات؛ إذ حذر كفوقلو من أن «البيانات الاصطناعية ذات الجودة المنخفضة قد تُدخل تحيزات أو تقلل من دقة النماذج». كما شدد خبراء آخرون على أن أي عيوب في البيانات الأصلية قد تتضخم عند إعادة إنتاجها اصطناعياً، ما ينعكس سلباً على أداء الأنظمة.

وأضافت لييفار: «البيانات الاصطناعية تحتاج دائماً إلى مقارنة مستمرة بمعايير العالم الواقعي لضمان بقائها ضمن نطاق الموثوقية».

أما كبيرة علماء اتخاذ القرار السابقة في «غوغل»، كاسي كوزيركوف، فقد لخّصت الأمر بوضوح: «البيانات الحقيقية تبقى الخيار الأفضل دائماً عندما يكون الهدف هو تمثيل الواقع بدقة».

logo
اشترك في نشرتنا الإلكترونية
تابعونا على
تحميل تطبيق الهاتف