ارائه روش انتخاب ویژگی مبتنی بر خوشه‌بندی در مسئله تشخیص هرزنامه

نویسندگان

1 دانشجوی دکتری، مهندسی کامپیوتر، دانشکده فنی و مهندسی، دانشگاه اراک، اراک، ایران

2 دانشیار، مهندسی کامپیوتر، دانشکده فنی و مهندسی، دانشگاه اراک، اراک، ایران

doi
10.22034/aimj.2022.170976
چکیده

یکی از راه‌های تشخیص هرزنامه، دسته‌بندی ایمیل‌ها به دو دسته هرزنامه و غیرهرزنامه است. کارایی بالای روش‌های یادگیری ماشین در مسائل گوناگون، باعث توسعه وسیع آنها در دسته‌بندی متون شده است. استفاده از یک سازوکار کاهش ویژگی کارآمد در الگوریتم‌های یادگیری ماشین مبتنی بر محتوا به‎‏منظور استخراج یک بردار ویژگی کارآمد از میان تعداد بسیار زیادی ایمیل نقش مهمی دارد. برخلاف روش‌های پیشین که فقط ویژگی‌های برتر را انتخاب کرده و باقی ویژگی‌ها را نادیده می‌گیرند، در روش پیشنهادی در این مقاله سعی شده است از ویژگی‌های انتخاب‌نشده نیز استفاده شود. روش کار به این صورت است که ابتدا یک انتخاب ویژگی اولیه اعمال شده و تعدادی ویژگی انتخاب می‌شود. سپس، ویژگی‌های انتخاب‎نشده خوشه‌بندی شده و هر خوشه به یک ویژگی جدید نگاشت می‌شود و بردار ویژگی نهایی شامل ویژگی‌های انتخاب‎شده و ویژگی‌های نگاشت‎شده از هر خوشه خواهد بود. در پژوهش حاضر، با اعمال دو روش انتخاب ویژگی اولیه و همچنین دو تابع نگاشت ویژگی‌های خوشه، در مجموع، چهار روش ارائه شد و نتایج با استفاده از دو پایگاه داده PU2 و PU3 تجزیه و تحلیل شدند. نتایج حاصل از تجزیه ‌و تحلیل انجام‎شده نشان داد که روش مبتنی بر انتخاب ویژگی اولیه DF و تابع نگاشت پیشرفته، در بین کلیه روش‌های پیشنهادی، دارای بالاترین کارایی است. همچنین، روش‏های پیشنهادی در مقایسه با انتخاب ویژگی اولیه (بدون خوشه‌بندی) دارای کارایی بهتری هستند.