ارائه یک روش ترکیبی برای داده افزایی و متوازن سازی مجموعه داده های نامتوازن

نویسندگان

1 دانشگاه الزهرا

2 دانشگاه فردوسی مشهد

3 دانشگاه شهید بهشتی

doi
10.22034/csj.2025.538051.1114
چکیده

یکی از چالش‌‌های مهم در یادگیری ماشین، داده‌‌های نامتوازن است. در مجموعه داده‌های نامتوازن، توزیع ناهمگون نمونه‌‌ها بین کلاس‌های مختلف، باعث می‌‌شود مدل‌‌های طبقه‌‌بندی عملکرد ضعیفی در شناسایی کلاس اقلیت (کلاس با تعداد نمونه کمتر) داشته باشند. این مشکل زمانی برجسته‌‌تر می‌‌شود که در یک کاربرد مشخص کلاس اقلیت دارای اهمیت بیشتری است. در این مقاله، یک روش ترکیبی برای حل مسئله داده‌‌های نامتوازن پیشنهاد می‌‌شود. این روش که HDAM نامیده می‌‌شود با هدف تولید نمونه‌‌های موثرتر برای کلاس اقلیت، دو تکنیک شناخته شده داده‌‌افزایی به نام‌‌های H-SMOTE و LoRAS را ترکیب می‌‌کند. ارزیابی‌های انجام شده نشان می‌‌دهند به‌صورت میانگین روش پیشنهادی برای هر سه طبقه‌‌بند جنگل تصادفی، K نزدیک‌‌ترین همسایه و شبکه عصبی پرسپترون چندلایه و براساس معیارهای مختلف شامل فراخوانی، دقت، AUC و F1 عملکرد بهتری در مقایسه با دو روش پایه دارد. برای نمونه، روش HDAM بر اساس معیار F1 در مقایسه با H-SMOTE که عملکرد بهتری نسبت به LoRAS داشته است، کارایی طبقه‌بندهای جنگل تصادفی، K نزدیک‌‌ترین همسایه و شبکه عصبی را به‌ترتیب 64/1، 05/0 و 1/6 درصد بهبود داده است.