ارائه روش انتخاب ویژگی مبتنی بر خوشهبندی در مسئله تشخیص هرزنامه
نویسندگان
1 دانشجوی دکتری، مهندسی کامپیوتر، دانشکده فنی و مهندسی، دانشگاه اراک، اراک، ایران
2 دانشیار، مهندسی کامپیوتر، دانشکده فنی و مهندسی، دانشگاه اراک، اراک، ایران
doi
10.22034/aimj.2022.170976چکیده
یکی از راههای تشخیص هرزنامه، دستهبندی ایمیلها به دو دسته هرزنامه و غیرهرزنامه است. کارایی بالای روشهای یادگیری ماشین در مسائل گوناگون، باعث توسعه وسیع آنها در دستهبندی متون شده است. استفاده از یک سازوکار کاهش ویژگی کارآمد در الگوریتمهای یادگیری ماشین مبتنی بر محتوا بهمنظور استخراج یک بردار ویژگی کارآمد از میان تعداد بسیار زیادی ایمیل نقش مهمی دارد. برخلاف روشهای پیشین که فقط ویژگیهای برتر را انتخاب کرده و باقی ویژگیها را نادیده میگیرند، در روش پیشنهادی در این مقاله سعی شده است از ویژگیهای انتخابنشده نیز استفاده شود. روش کار به این صورت است که ابتدا یک انتخاب ویژگی اولیه اعمال شده و تعدادی ویژگی انتخاب میشود. سپس، ویژگیهای انتخابنشده خوشهبندی شده و هر خوشه به یک ویژگی جدید نگاشت میشود و بردار ویژگی نهایی شامل ویژگیهای انتخابشده و ویژگیهای نگاشتشده از هر خوشه خواهد بود. در پژوهش حاضر، با اعمال دو روش انتخاب ویژگی اولیه و همچنین دو تابع نگاشت ویژگیهای خوشه، در مجموع، چهار روش ارائه شد و نتایج با استفاده از دو پایگاه داده PU2 و PU3 تجزیه و تحلیل شدند. نتایج حاصل از تجزیه و تحلیل انجامشده نشان داد که روش مبتنی بر انتخاب ویژگی اولیه DF و تابع نگاشت پیشرفته، در بین کلیه روشهای پیشنهادی، دارای بالاترین کارایی است. همچنین، روشهای پیشنهادی در مقایسه با انتخاب ویژگی اولیه (بدون خوشهبندی) دارای کارایی بهتری هستند.