ارائه الگوریتم ترکیبی پالایشی-پوششی انتخاب ویژگی و کاربرد آن در کاهش بعد داده های بیان ژن
نویسندگان
1 دانشگاه قم
2 دانشگاه قم
3 دانشگاه قم
4
doi
چکیده
امروزه بالا رفتن حجم دادهها و تعداد ویژگیها در مجموعه داده، باعث کاهش دقت الگوریتم یادگیری و پیچیدگی محاسباتی شده است. . روشهای کاهش بعد، نوعی از روش انتخاب مشخصه هستند که به دو صورت پالایشی و پوششی انجام میشود. دقت روشهای پوششی نسبت به روشهای پالایشی بالاتر است اما در مقابل، روشهای پالایشی سریعتر عمل میکنند و پیچیدگیهای محاسباتی کمتری دارند. با در نظر گرفتن مزایا و معایب الگوریتمهای پالایشی و پوششی، در این پژوهش یک روش ترکیبی جدید ارائه شده است. در این روش، ابتدا کل مشخصههای موجود در مجموعه داده در نظر گرفته میشوند سپس با ترکیب الگوریتمهای پالایشی انتخاب مشخصه و ارزشگذاری نتایج آن به روش پوششی، زیرمجموعهای بهینه از مشخصهها انتخاب میشوند. با توجه به اینکه بسیاری از بیماریها و مسائل زیست سیستمی نظیر سرطان، به کمک بررسی دادهی ریزآرایه قابل شناسایی و تشخیص هستند و با توجه به اینکه تعداد مشخصهها در این مجموعه دادهها بسیار بالا است؛ روش ارائه شده در این پژوهش برروی دادهی ریزآرایه مربوط به سه نوع سرطان مورد ارزیابی قرار گرفته است.این روش، در مقایسه با روشهای مشابه، به دقت بالایی در دستهبندی و شناسایی عوامل مؤثر در سرطان به خصوص سرطان خون دست یافته است.