بهینهسازی الگوریتم k-میانگین در خوشهبندی دادهها با استفاده از الگوریتم هوش جمعی بهینهسازی گرگ خاکستری و الگوریتم تشخیص داده پرت جنگل جداسازی
نویسندگان
1 دانشگاه تربیت مدرس
2 دانشگاه تبریز
doi
10.22034/csj.2024.209865چکیده
امروزه علم داده و خوشهبندی دادهها بهعنوان ابزارهای حیاتی برای تحلیل و پردازش دادههای خام و استخراج دانش به منظور تصمیمسازی و تصمیمگیریهای کلان شناخته میشوند. یکی از روشهای اصلی طبقهبندی دادهها، خوشهبندی است که در آن عناصر درون هر خوشه باید با یکدیگر مشابه و با عناصر خوشههای دیگر متفاوت باشند. الگوریتم k- میانگین بهعنوان یکی از روشهای پرکاربرد در خوشهبندی دادهها بهشمار میآید و در بسیاری از کاربردهای عملی مورد استفاده قرار میگیرد. با این حال، این الگوریتم دارای دو نقص اساسی است: اول، وابستگی شدید کیفیت خوشهها به انتخاب مراکز اولیه، و دوم، تأثیر نقاط پرت بر عملکرد خوشهبندی. در این مقاله، یک روش پیشرفته برای بهینهسازی الگوریتم k- میانگین با استفاده از الگوریتم بهینهسازی گرگ خاکستری (GWO) برای انتخاب اولیه مراکز خوشه و همچنین الگوریتم جنگل جداسازی (IF) برای حذف نقاط پرت معرفی شده است. در این مقاله آزمایشهای مختلف بر روی مجموعه دادههای سنتزی و دادههای واقعی انجام شد و هر کدام از آزمایشها با دو سنجه شاخص رند اصلاح شده و خطای تعداد خوشهها (میانگین اختلاف بین تعداد خوشههای واقعی و تعداد براورد شده توسط الگوریتم) مورد ارزیابی قرار گرفتند. آزمایشهای انجام شده نشان داد که الگوریتم پیشنهادی هم از نظر شاخص رند اصلاح شده و هم از نظر خطای تعداد خوشهها پیشرفت قابل ملاحظهای را در مقایسه با k-میانگین پایه نشان میدهد. به گونهای که در شاخص رند اصلاح شده، امتیاز آن از 74/0 به 93/0 ارتقا یافت. همچنین از نظرمیانگین تعداد خطای خوشهها، میانگین خطای آن از عدد 47/0 به 16/0 کاهش یافت این آزمایشهای گسترده و متعدد بر روی دادههای متنوع نشان داد که این الگوریتم ترکیبی توانسته است به شکل قابل ملاحظهای الگوریتم k- میانگین اولیه را از جهات گوناگون بهبود ببخشد و بتواند راهحلی نویدبخش برای کاربردهای آتی خوشهبندی دادهها باشد.