تشخیص تقلب در بیمه خودرو با استفاده از خوشهبندی بهبود یافته با الگوریتم ژنتیک
نویسندگان
1 گروه علوم کامپیوتر، دانشکده ریاضی و علوم کامپیوتر، دانشگاه صنعتی امیرکبیر (پلی تکنیک تهران)، تهران، ایران.
2 گروه علوم کامپیوتر، دانشکده ریاضی و علوم کامپیوتر، دانشگاه صنعتی امیرکبیر (پلی تکنیک تهران)، تهران، ایران.
3 گروه علوم کامپیوتر، دانشکده ریاضی و علوم کامپیوتر، دانشگاه صنعتی امیرکبیر (پلی تکنیک تهران)، تهران، ایران.
4 گروه علوم کامپیوتر، دانشکده ریاضی و علوم کامپیوتر، دانشگاه صنعتی امیرکبیر (پلی تکنیک تهران)، تهران، ایران.
5 گروه علوم کامپیوتر، دانشکده ریاضی و علوم کامپیوتر، دانشگاه صنعتی امیرکبیر (پلی تکنیک تهران)، تهران، ایران.
doi
10.22056/ijir.2025.02.02چکیده
پیشینه و اهداف: خوشهبندی یکی از روشهای اساسی در دادهکاوی و یادگیری ماشین است که برای تقسیم مجموعهای از دادهها به زیرمجموعههای همگن به کار میرود. روشهای مختلفی برای انجام خوشهبندی وجود دارد که هریک نقاط قوت و ضعف خاص خود را دارند. یکی از چالشهای اصلی در خوشهبندی، یافتن تعداد خوشههای بهینه و تخصیص بهینة دادهها به این خوشههاست. الگوریتم ژنتیک، بهعنوان روش بهینهسازی مبتنی بر تکامل طبیعی، توانایی بالایی در حل مسائل پیچیده و جستوجوی فضای جوابهای بزرگ دارد و میتواند بهعنوان یک ابزار مؤثر در خوشهبندی به کار رود. هدف این مقاله، بررسی کارایی و دقت الگوریتم ژنتیک در کلاسبندی دادهها و مقایسة آن با روشهای سنتی خوشهبندی برای کلاسبندی است. بهمنظور ارزیابی عملکرد این الگوریتم، چندین مجموعه داده بیمه استفاده شده و نتایج بهدستآمده با معیارهای مختلفی مانند دقت تحلیل میشوند. همچنین، پارامترهای مختلف الگوریتم ژنتیک بررسیشده و تأثیر آنها بر عملکرد نهایی الگوریتم مطالعه میشود تا بهینهترین تنظیمات برای کلاسبندی دادهها تعیین شود.روششناسی: در این پژوهش، بهمنظور تشکیل کروموزومها، ابتدا تعداد خوشهها مشخص شد. با توجه به اینکه هر مرکز خوشه به اندازة تعداد ویژگیهای مجموعه داده دارای ویژگی بود، طول هر کروموزوم بهصورت حاصلضرب تعداد خوشهها در تعداد ویژگیها تعیین شد. برای فرایندهایCrossover ،Mutation و Survival از روشهای نوین و متنوعی بهره گرفته شد. همچنین، معیار ارزیابی مشابه الگوریتم K-means انتخاب شد تا عملکرد خوشهبندی بهینهسازی شود. این رویکرد نوآورانه به بهبود دقت و کارایی فرایند کلاسبندی منجر شد.یافتهها: با اعمال روش توضیحدادهشده در این مقاله برای تشخیص تقلب در ۳ مجموعه دادة بیمه، به نتایج جالب توجهی با 12% بهبود در F1 و 10% افزایش دقت در مجموعه دادة اول، 1% بهبود F1 و دقت در مجموعه دادة دوم و در نهایت نیز 1% بهبود در F1 و 2% بهبود در دقت مجموعه دادة سوم نسبت به روشK-means و سایر روشها حاصل شده است. با توجه به ۲ کلاس بودن دادهها در این مجموعه دادهها، مسئله بهازای ۲ خوشه با استفاده از الگوریتم حل شده و بهترین برچسب برای هر خوشه با توجه به برچسبهای واقعی دادگان انتخاب شده و نتیجه بهصورت نتایج حاصل از مسائل دستهبندی ارائه شده است، همچنین بهبود چشمگیری در معیارهایی همچون ARI و سایر معیارهای ارزیابی خوشهبندی حاصل شده و پیشرفت چشمگیری نسبت به الگوریتم ژنتیک عادی نیز حاصل شده است.نتیجهگیری: الگوریتم ژنتیک قابلیت حل مسائل پیچیده و بدون راهحل قطعی را دارد و میتواند در خوشهبندی دادهها عملکرد بهتری نسبت به روشهای سنتی مانندK-means داشته باشد. این رویکرد با ترکیب احتمالات و تصادفی بودن، امکان بررسی نقاط بیشتر بهعنوان مراکز خوشه و بهبود عملکرد خوشهبندی را فراهم میکند. نتایج نشان میدهد که این روش در برخی موارد بهتر از روشهای معروف عمل میکند و ساختار مناسبی برای خوشهبندی دادهها ارائه میدهد.