تصحیح خودکار دادهها مبتنی بر وابستگی تابعی و سیستم یادگیری مرکب
نویسندگان
1 تهران - دانشگاه تربیت دبیر شهید رجایی - دانشکده مهندسی کامپیوتر
2 تهران - دانشگاه تربیت دبیر شهید رجایی - دانشکده مهندسی کامپیوتر
doi
چکیده
صحت دادهها یکی از مهمترین ابعاد کیفیت دادهها بهشمارمیرود. با توجه به حجم بالای منابع دادهای نیاز به روشهایی خودکار وجود دارد. در این مقاله راهکاری خودکار برای تصحیح دادههایی با انواع دادهای متفاوت ارائه شده است. در این راهکار در ابتدا رکوردهایی که احتمالاً حاوی ویژگی خطا است با استفاده از وابستگی تابعی شناساییمیگردد، بدینصورت که رکوردی که به ازای یک وابستگی تابعی با بیش از از رکوردها در تناقض باشد، مشکوک به خطا است. سپس به ازای هر ویژگی از منبع داده مورد بررسی، سیستم یادگیری مرکب ساختهمیشود. سیستم یادگیری مرکب از سه طبقهبند بیز، درخت تصمیم و شبکه عصبی MLP تشکیلشده است و دارای استراتژی ترکیب رأی اکثریت است. سیستم یادگیری مرکب بهوسیله رکوردهای صحیح شناساییشده مورد آموزش قرارداده میشود. پس از آموزش طبقهبندها، هر ویژگی غلط بهعنوان کلاس هدف سیستم یادگیریمرکب قرارمیگیرد و مقداری برای آن پیشبینیمیگردد. روش پیشنهادی قادراست چندین خطا در یک رکورد را شناسایی نماید. آزمایشها نشانمیدهد که true negative rate الگوریتم پیشنهادی در بخش تشخیص خطا بهطور متوسط 93.7% و در بخش تصحیح خطا بهطور متوسط 90.6% است. همچنین آزمایشها نشانمیدهد که میزان پارامترهای ارزیابی در الگوریتم پیشنهادی در مقایسه با دو الگوریتم مشابه مبتنی بر وابستگی تابعی بهبود داشته است.