مساهمة تقنيات الذكاء الاصطناعي في تحسين جودة متطلبات البرمجيات: إطار عمل هجين قابل للتفسير قائم على التوليد المعزز بالاسترجاع (RAG) للتقييم الآلي لجودة متطلبات البرمجيات
الكلمات المفتاحية:
هندسة متطلبات البرمجيات، جودة المتطلبات، التوليد المعزز بالاسترجاع (RAG)، النماذج اللغوية الكبيرة (LLMs)، الذكاء الاصطناعي القابل للتفسير (XAI)، SHAP، نماذج المحولات (Transformers)، روائح المتطلبات Requirements Smells)).الملخص
تُعد جودة متطلبات البرمجيات محددًا حاسمًا لنجاح المشاريع في المراحل اللاحقة، إلا أن المراجعة اليدوية لمواصفات المتطلبات للكشف عن الغموض، عدم الملاءمة، التناقض، والعيوب ذات الصلة لا تزال تتطلب كثافة في العمل وتفتقر إلى الاتساق بين المراجعين. تقترح هذه الورقة إطار عمل هجينًا وقابلاً للتفسير ومعززًا بالاسترجاع، يجمع بين: تضمينات نموذج Sentence-BERT.الاسترجاع القائم على FAISS عبر معايير هندسة المتطلبات المعتمدة (مثل ISO/IEC 29148، وIEEE 830، و SWEBOK، وتصنيف "روائح المتطلبات" - Requirements Smells). نموذج لغوي ضخم (LLM) للكشف عن العيوب، وتوفير الشرح بلغة طبيعية، وإعادة الصياغة. قابلية التفسير القائمة على SHAP لتقديم تقييم شفاف للجودة. قمنا ببناء "مجموعة بيانات جودة المتطلبات الموحدة" (URQD) من خلال دمج وإعادة ترميز ثلاثة مصادر عامة هي: مجموعة بيانات PURE، ومستودع PROMISE، ومجموعة بيانات Requirements-Smells. كما قمنا بمقارنة المصنف الهجين المقترح (SBERT+XGBoost) مع خطوط الأساس الكلاسيكية للتعلم الآلي (مثل SVM، و Random Forest، و XGBoost عبر ميزات TF-IDF) بالإضافة إلى نماذج المحولات الضخمة الضبط (BERT، و RoBERTa، و DeBERTa-v3).على مجموعة عينات الاختبار المستقلة (Held-out test split)، حقق النموذج الهجين المقترح دقة بلغت 97.31% ومعدل F1-score قدره 0.9692، متفوقًا على جميع خطوط الأساس القائمة على TF-IDF، ومحسنًا معامل ارتباط ماثيوز (Matthews Correlation Coefficient) بمقدار 18.2 نقطة مئوية مقارنة بأقوى نموذج أساسي. أكدت التحققات المتقاطعة المطبقة بعشر طيات (Ten-fold stratified cross-validation) هذا التحسن (بمتوسط F1 = 0.9773)، كما أشار اختبار فريدمان (Friedman test) إلى أن الفروق بين النماذج ذات دلالة إحصائية ($\chi^2 = 25.56, p = 1.18 \times 10^{-5}$).أما نماذج المحولات الضخمة الضبط (Fine-tuned transformer models)، والتي تم تقييمها بشكل منفصل، فقد حققت أعلى درجات تصنيف خام (حيث سجل نموذج RoBERTa دقة بلغت 99.82%)، ولكن بتكلفة حسابية وتكلفة ترميز بيانات أعلى بكثير، مما يعزز أهمية التصميم الهجين المعزز بالاسترجاع كبديل أخف وزنًا وأكثر قابلية للتفسير ومناسبًا للتطبيق العملي. نناقش في هذه الورقة المفاضلات بين الدقة، قابلية التفسير، والتكلفة، ونستعرض التهديدات التي تواجه صحة النتائج بالإضافة إلى توجهات العمل المستقبلي.
منشور
كيفية الاقتباس
إصدار
القسم

هذا العمل مرخص بموجب Creative Commons Attribution 4.0 International License.