جستاری بر فرایند سازماندهی و بازیابی متون وبی مبتنی بر تجمیع مفاهیم معنایی در راستای سازماندهی دانش
نویسندگان
1 گروه مهندسی کامپیوتر؛ واحد قوچان؛ دانشگاه آزاد اسلامی؛ قوچان، ایران؛
2 گروه مهندسی کامپیوتر؛ واحد مشهد؛ دانشگاه آزاد اسلامی؛ مشهد، ایران
3 گروه علم اطلاعات و دانششناسی؛ دانشگاه فردوسی مشهد؛ ایران
doi
10.35050/JIPM010.2019.025چکیده
سازماندهی و بازیابی دانش منتشرشده در محیط وب بهعنوان یکی از مهمترین کاربردهای متنکاوی مطرح است. از جمله چالشهای سازماندهی مجموعه عظیمی از متون در قالب یک پیکره متنی، ابعاد زیاد ویژگیها و خلوت بودن ماتریس ویژگیهاست. نحوه انتخاب ویژگیها و کاهش آنها در این مسئله تأثیر بهسزایی در بالاتر رفتن دقت سازماندهی و بازیابی متون دارد. در بسیاری از پژوهشها به بررسی جداگانه این دو چالش پرداخته شده است. این پژوهش با رویکرد توجه همزمان به این دو چالش انجام گرفته است. پس از تعیین متون مرتبط با 20 گروه خبری وبی و پس از فاز پیشپردازش متون با استفاده از الگوریتم الگوسازی عنوان «الدیاِی»، کیسهای (تجمیعی) از مفاهیم معنایی برای پیکره متنی مورد نظر ساخته شد. بهمنظور بررسی میزان تأثیر واژههای پیکره متون در هر مفهوم پنهان، به بررسی نحوه وزندهی واژگان یک پیکره، در مفاهیم استخراجشده توسط الگوریتم «الدیاِی» پرداخته شد. از این رو، برای هر متن یک توزیع احتمال رخداد حول هر عنوان استخراج گردید که برای سازماندهی و بازیابی دانش موجود در آن مورد استفاده قرار گرفت. برای سازماندهی آن از الگوریتم نزدیکترین K همسایه با معیار شباهت واگرای «کولبک لیبلر» که میزان فاصله دو توزیع احتمال را میسنجد؛ استفاده شد. نتایج آزمونها نشان داد که میزان صحت سازماندهی روش پیشنهادی در صورتی که از معیار وزندهی واکشی اطلاعات متقابل نقطهای و الگوریتم KL-KNN استفاده شده باشد، 5/82 درصد است. نتایج تحلیلها نشان داد که این روش دارای دقتی مشابه با روشهایی است که از فنون یادگیری عمیق استفاده مینمایند. افزون بر این، روش بهکاررفته در این پژوهش نشاندهنده پیچیدگی کمتر در فرایند سازماندهی و بازیابی متون مورد مطالعه پژوهش بود.