کاربست قوانین انجمنی و خوشه‌بندی در کنترل کیفیت داده‌های پژوهشی؛ مورد مطالعه پایگاه اطلاعات علمی ایران (گنج)

نویسندگان

1 پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک) ،تهران ، ایران

2 پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک) ،تهران ، ایران

3 دانشگاه صنعتی امیرکبیر،تهران ، ایران

doi
10.22034/jipm.2023.698614
چکیده

پایگاه‌های اطلاعات علمی و موتورهای جست‌وجو از ابزارهای اصلی کار پژوهشگران است. برای بازیابی دقیق و صحیح اطلاعات از این پایگاه‌ها نیاز است که اطلاعات با کیفیت مناسب و با کمترین خطا ذخیره شود. کنترل دستی اطلاعات زمان‌بر و پُرهزینه است. در این مقاله، روش‌های داده‌کاوی برای کنترل کیفیت پایگاه اطلاعات پژوهشی معرفی می‌شود. برای این منظور، ابتدا باید اطلاعاتی از خطاهای مرسوم را در کنار سایر اطلاعات هر رکورد جمع‌آوری کرد. سپس، با استفاده از روش‌های داده‌کاوی الگوهای پنهان و روابط بین خطاها را کشف کرد و بر این اساس، راه‌های بهبود کیفیت داده را ارائه داد. در این مقاله پایگاه اطلاعات علمی ایران (گنج)، به‌عنوان مطالعة موردی در نظر گرفته شد. 59 کد خطا توسط خبرگان تعریف شد. سپس، اطلاعات فرادادة هر رکورد مثل نام دانشگاه، نام رشته،گرایش و حوزة تخصصی مدرک به ‌همراه کدهای خطای آن در یک مجموعه داده ‌ذخیره شد. این مجموعه داده شامل 41021‌ رکورد ‌در حوزه‌های مختلف است. با استفاده از روش‌های آماری و قوانین انجمنی رابطه بین خطاها و الگوی تکرار آن‌ها درهر حوزه بررسی شد. نتایج نشان داد که ‌به‌طور میانگین با در نظر گرفتن 25 درصد از خطاها در هر حوزه، می‌توان تا 80 درصد از خطاهای همة رکوردهای یک حوزه را کاهش داد. این خطاها شامل خطاهای پرتکرار در هر حوزه و همچنین خطاهایی است که با آن‌ها رابطة قوی دارند. با استفاده از روش خو‌شه‌بندی k-means رکوردها خوشه‌بندی شدند. نتایج نشان داد که اگرچه شباهت‌هایی بین رکوردها از حوزه‌های مختلف وجود دارد، اما رابطة معناداری بین حوزة رکوردها و الگوی تکرار خطاها وجود ندارد.