بررسی الگوریتم‌های رده‌بندی در پیش‌بینی داده‌های سلامت: یک مطالعه مروری‏

نویسندگان

1 دانشجوی کارشناسی ارشد، فن‌آوری اطلاعات، دانشکده مهندسی صنایع، ‏دانشگاه صنعتی خواجه نصیرالدین طوسی، تهران، ایران

2 ‏استادیار، مهندسی کامپیوتر، گروه فن‌آوری اطلاعات، دانشکده مهندسی صنایع، ‏دانشگاه صنعتی خواجه نصیرالدین طوسی، تهران، ایران ‏

doi
چکیده

داده‌کاوی ابزاری جهت استخراج اطلاعات مفید از مجموعه‌ داده‌های عظیم، از جمله زمینه‌های مور‌د‌ علاقه محققان در حوزه سلامت محسوب می‌شود. رده‌بندی، یک تابع یادگیری می‌باشد که هر داده را به یکی از دسته‌های از قبل تعریف‌ شده، نگاشت می‌‌کند. بر اساس گزارش‌های سازمان بهداشت جهانی، بیماری‌های قلبی، کلیوی، دیابت و سرطان‌ها در سال 2012 عامل 68 درصد از مرگ‌ها بوده‌‌اند. پژوهش حاضر، با هدف مطالعه و بررسی انواع الگوریتم‌های رده‌بندی و نتایج آن‌ها درون حوزه سلامت در مطالعات پیشین انجام شد. این مطالعه از نوع مروری- نقلی‌ بود که در آن، مطالعات مرتبط برای بیماری‌های قلبی، سرطان‌ سینه و دیابت از سال 2003 تا 2015 بررسی گردید. کلمات کلیدی «Data mining، Classification، Health، Heart disease، Diabetes و Breast cancer» در پایگاه‌های اطلاعاتی ScienceDirect، Elsevier، Springer و IEEE ‌جستجو و منابع هر مقاله و مقالات ‌استناد‌ شده به آن نیز جمع‌آوری شد. پس از حذف مطالعات نامتناسب، 34 مقاله انتخاب گردید. جمع‌بندی مطالعات نشان داد که تکرار استفاده از الگوریتم شبکه ‌عصبی، برای هر سه بیماری بیشتر بود. الگوریتم‌های شبکه‌ عصبی و بیز‌ ساده برای بیماری‌ قلبی، نزدیک‌ترین ‌همسایگان برای سرطان ‌سینه و شبکه‌ عصبی برای دیابت بالاترین دقت را داشت. به طو‌ر کلی می‌توان دریافت، با وجود این که نمی‌توان با قطعیت یک الگوریتم را بهترین الگوریتم برای هر بیماری دانست، اما تعیین بهترین الگوریتم‌ها برای هر بیماری، می‌تواند برای مطالعات آینده مفید باشد.