یک معیار شباهت مبتنی بر محبوبیت برای بهبود کارایی خوشه‌بندی طیفی

نویسندگان

1 دانشگاه سیستان و بلوچستان

doi
10.22034/csj.2024.203192
چکیده

روش‌های خوشه‌بندی طیفی، به دلیل قابلیتی که در تشخیص خوشه‌های با شکل‌های مختلف دارند، بسیار مورد توجه قرار گرفته‌اند. کارایی این روش‌ها وابستگی شدیدی به نحوه تعریف شباهت بین نمونه‌ها دارد. بنابراین، تلاش‌ها برای بهبود کارایی این الگوریتم‌ها بر روی ارایه معیار شباهت مناسب‌تر متمرکز بوده است. در این مقاله، به هر نمونه شاخصی تحت عنوان شاخص محبوبیت نسبت می‌دهیم که بیانگر میزان مرکزیت آن نمونه در مجموعه داده است. همچنین، معیار شباهت جدیدی مبتنی بر محبوبیت نمونه‌ها پیشنهاد و بر پایه آن الگوریتم خوشه‌بندی طیفی مبتنی بر محبوبیت را پیشنهاد می‌دهیم. از آنجا که شاخص محبوبیت پیشنهادی مستقل از چگالی محلی خوشه‌هاست، الگوریتم پیشنهادی می‌تواند در خوشه‌بندی داده‌های با چگالی‌های متفاوت موفق عمل کند. معیار پیشنهادی ویژگی سودمند دیگری نیز دارد؛ شباهت نمونه‌ها در معیار پیشنهادی با توجه به محبوبیت آنها و جایگاه یک نمونه در لیست همسایگان نمونه دیگر محاسبه می‌شود. این ویژگی به جداسازی خوشه‌های با همپوشانی بالا کمک بسیاری می‌کند. به دلیل سادگی تعریف پیشنهادی برای شاخص محبوبیت، الگوریتم محاسبه ماتریس شباهت پیشنهادی پیچیدگی محاسباتی بسیار پایینی دارد. برای مطالعه و مقایسه کارایی الگوریتم خوشه‌بندی پیشنهادی با همتاهای آن، از منظر معیار انطباق NMI، آزمایش‌هایی بر روی شش مجموعه داده‌ مصنوعی و پانزده مجموعه داده واقعی انجام داده‌ایم. نتایج نشان می‌دهد که الگوریتم خوشه‌بندی پیشنهادی و معیار شباهت مطرح در آن کارایی بهتری نسبت به روش‌های همتای آن از جمله معیار شباهت مبتنی بر میانگین محلی، معیار خود- تنظیم و معیار شباهت محلی مبتنی بر همسایه‌های مشترک دارد و در اغلب موارد بهترین عملکرد را به‌دست می‌آورد.