ارائه یک روش ترکیبی برای داده افزایی و متوازن سازی مجموعه داده های نامتوازن
نویسندگان
1 دانشگاه الزهرا
2 دانشگاه فردوسی مشهد
3 دانشگاه شهید بهشتی
doi
10.22034/csj.2025.538051.1114چکیده
یکی از چالشهای مهم در یادگیری ماشین، دادههای نامتوازن است. در مجموعه دادههای نامتوازن، توزیع ناهمگون نمونهها بین کلاسهای مختلف، باعث میشود مدلهای طبقهبندی عملکرد ضعیفی در شناسایی کلاس اقلیت (کلاس با تعداد نمونه کمتر) داشته باشند. این مشکل زمانی برجستهتر میشود که در یک کاربرد مشخص کلاس اقلیت دارای اهمیت بیشتری است. در این مقاله، یک روش ترکیبی برای حل مسئله دادههای نامتوازن پیشنهاد میشود. این روش که HDAM نامیده میشود با هدف تولید نمونههای موثرتر برای کلاس اقلیت، دو تکنیک شناخته شده دادهافزایی به نامهای H-SMOTE و LoRAS را ترکیب میکند. ارزیابیهای انجام شده نشان میدهند بهصورت میانگین روش پیشنهادی برای هر سه طبقهبند جنگل تصادفی، K نزدیکترین همسایه و شبکه عصبی پرسپترون چندلایه و براساس معیارهای مختلف شامل فراخوانی، دقت، AUC و F1 عملکرد بهتری در مقایسه با دو روش پایه دارد. برای نمونه، روش HDAM بر اساس معیار F1 در مقایسه با H-SMOTE که عملکرد بهتری نسبت به LoRAS داشته است، کارایی طبقهبندهای جنگل تصادفی، K نزدیکترین همسایه و شبکه عصبی را بهترتیب 64/1، 05/0 و 1/6 درصد بهبود داده است.