پیشبینی عملکرد تحصیلی دانشجویان یکی از موضوعات مهم و چالشبرانگیز در حوزه یادگیری ماشینی و آموزش عالی محسوب میشود، زیرا میتواند نقش کلیدی در شناسایی دانشجویان در معرض خطر و ارائه راهکارهای حمایتی و پیشگیرانه ایفا کند. در حالی که پژوهشهای پیشین عمدتاً بر الگوریتمهای سنتی یادگیری ماشین و تکنیکهای دادهمحور مانند SMOTE متمرکز بودهاند، این تحقیق رویکردی جامعتر و چندبعدی را اتخاذ کرده است.
دادههای مورد استفاده در این پژوهش از چندین مؤسسه و چندین درس مختلف گردآوری شدهاند تا محدودیت تعمیمپذیری پژوهشهای پیشین کاهش یابد و نتایج حاصل قابلیت کاربرد در محیطهای متنوعتر آموزشی را داشته باشند. علاوه بر الگوریتمهای کلاسیک مانند J48، Random Forest (RF)، Support Vector Machine (SVM)، k-Nearest Neighbors (kNN)، Logistic Regression (LR) و Naive Bayes (NB)، در این مطالعه الگوریتمهای یادگیری عمیق شامل شبکههای عصبی کانولوشنی (CNN) و بازگشتی (RNN) و همچنین مدلهای ترکیبی پیشرفته مانند XGBoost و AutoML مورد بررسی قرار گرفتهاند.
برای مقابله با عدم تعادل دادهها و توزیع نامتوازن نمونههای آموزشی، علاوه بر SMOTE، از روشهای ADASYN و یادگیری حساس به هزینه (Cost-Sensitive Learning) نیز استفاده شده است تا مدلها توانایی بهتری در شناسایی نمونههای کمتکرار و بحرانی داشته باشند. نتایج نشان داد که مدلهای یادگیری عمیق قادر به شناسایی روابط غیرخطی پیچیده میان ویژگیها و عملکرد تحصیلی دانشجویان هستند و مدل XGBoost با رویکرد هیبریدی، بهترین تعادل را بین معیارهای Accuracy، Precision، Recall و F-measure برقرار کرده است.