یک معیار شباهت مبتنی بر محبوبیت برای بهبود کارایی خوشهبندی طیفی
نویسندگان
1 دانشگاه سیستان و بلوچستان
doi
10.22034/csj.2024.203192چکیده
روشهای خوشهبندی طیفی، به دلیل قابلیتی که در تشخیص خوشههای با شکلهای مختلف دارند، بسیار مورد توجه قرار گرفتهاند. کارایی این روشها وابستگی شدیدی به نحوه تعریف شباهت بین نمونهها دارد. بنابراین، تلاشها برای بهبود کارایی این الگوریتمها بر روی ارایه معیار شباهت مناسبتر متمرکز بوده است. در این مقاله، به هر نمونه شاخصی تحت عنوان شاخص محبوبیت نسبت میدهیم که بیانگر میزان مرکزیت آن نمونه در مجموعه داده است. همچنین، معیار شباهت جدیدی مبتنی بر محبوبیت نمونهها پیشنهاد و بر پایه آن الگوریتم خوشهبندی طیفی مبتنی بر محبوبیت را پیشنهاد میدهیم. از آنجا که شاخص محبوبیت پیشنهادی مستقل از چگالی محلی خوشههاست، الگوریتم پیشنهادی میتواند در خوشهبندی دادههای با چگالیهای متفاوت موفق عمل کند. معیار پیشنهادی ویژگی سودمند دیگری نیز دارد؛ شباهت نمونهها در معیار پیشنهادی با توجه به محبوبیت آنها و جایگاه یک نمونه در لیست همسایگان نمونه دیگر محاسبه میشود. این ویژگی به جداسازی خوشههای با همپوشانی بالا کمک بسیاری میکند. به دلیل سادگی تعریف پیشنهادی برای شاخص محبوبیت، الگوریتم محاسبه ماتریس شباهت پیشنهادی پیچیدگی محاسباتی بسیار پایینی دارد. برای مطالعه و مقایسه کارایی الگوریتم خوشهبندی پیشنهادی با همتاهای آن، از منظر معیار انطباق NMI، آزمایشهایی بر روی شش مجموعه داده مصنوعی و پانزده مجموعه داده واقعی انجام دادهایم. نتایج نشان میدهد که الگوریتم خوشهبندی پیشنهادی و معیار شباهت مطرح در آن کارایی بهتری نسبت به روشهای همتای آن از جمله معیار شباهت مبتنی بر میانگین محلی، معیار خود- تنظیم و معیار شباهت محلی مبتنی بر همسایههای مشترک دارد و در اغلب موارد بهترین عملکرد را بهدست میآورد.