بهینه‌سازی الگوریتم k-میانگین در خوشه‌بندی داده‌ها با استفاده از الگوریتم هوش جمعی بهینه‌سازی گرگ خاکستری و الگوریتم تشخیص داده پرت جنگل جداسازی

نویسندگان

1 دانشگاه تربیت مدرس

2 دانشگاه تبریز

doi
10.22034/csj.2024.209865
چکیده

امروزه علم داده و خوشه‌بندی داده‌ها به‌عنوان ابزارهای حیاتی برای تحلیل و پردازش داده‌های خام و استخراج دانش به منظور تصمیم‌سازی و تصمیم‌گیری‌های کلان شناخته می‌شوند. یکی از روش‌های اصلی طبقه‌بندی داده‌ها، خوشه‌بندی است که در آن عناصر درون هر خوشه باید با یکدیگر مشابه و با عناصر خوشه‌های دیگر متفاوت باشند. الگوریتم k- میانگین به‌عنوان یکی از روش‌های پرکاربرد در خوشه‌بندی داده‌ها به‌شمار می‌آید و در بسیاری از کاربردهای عملی مورد استفاده قرار می‌گیرد. با این حال، این الگوریتم دارای دو نقص اساسی است: اول، وابستگی شدید کیفیت خوشه‌ها به انتخاب مراکز اولیه، و دوم، تأثیر نقاط پرت بر عملکرد خوشه‌بندی. در این مقاله، یک روش پیشرفته برای بهینه‌سازی الگوریتم  k- میانگین با استفاده از الگوریتم بهینه‌سازی گرگ خاکستری (GWO) برای انتخاب اولیه مراکز خوشه و همچنین الگوریتم جنگل جداسازی (IF) برای حذف نقاط پرت معرفی شده است. در این مقاله آزمایش‌های مختلف بر روی مجموعه داده‌‌های سنتزی و داده‌‌های واقعی انجام شد و هر کدام از آزمایش‌‌ها با دو سنجه شاخص رند اصلاح شده و خطای تعداد خوشه‌‌ها (میانگین اختلاف بین تعداد خوشه‌‌های واقعی و تعداد براورد شده توسط الگوریتم) مورد ارزیابی قرار گرفتند. آزمایش‌های انجام شده نشان داد که الگوریتم پیشنهادی هم از نظر شاخص رند اصلاح شده و هم از نظر خطای تعداد خوشه‌‌ها پیشرفت قابل ملاحظه‌‌ای را در مقایسه با k-میانگین پایه نشان می‌‌دهد. به گونه‌‌ای که در شاخص رند اصلاح شده، امتیاز آن از 74/0 به 93/0 ارتقا یافت. همچنین از نظرمیانگین تعداد خطای خوشه‌‌ها، میانگین خطای آن از عدد 47/0 به 16/0 کاهش یافت این آزمایش‌های گسترده و متعدد بر روی داده‌های متنوع نشان داد که این الگوریتم ترکیبی توانسته است به شکل قابل ملاحظه‌ای الگوریتم  k- میانگین اولیه را از جهات گوناگون بهبود ببخشد و بتواند راه‌حلی نویدبخش برای کاربردهای آتی خوشه‌بندی داده‌ها باشد.