مقایسه عملکرد رویکردهای کشف و استخراج موضوعات کتاب‌های الکترونیکی

نویسندگان

1 دانشگاه اصفهان، اصفهان، ایران

2 دانشکده علوم تربیتی و روان‌شناسی، دانشگاه اصفهان، اصفهان، ایران

3 گروه هوش مصنوعی، دانشکده مهندسی کامپیوتر، دانشگاه اصفهان، اصفهان، ایران

doi
10.22034/jipm.2023.698598
چکیده

استخراج کلمات کلیدی از مسائل مهم در زمینه پردازش و تحلیل متن بوده و خلاصه‌ای سطح بالا و دقیق از متن ارائه می‌دهد. بنابراین، انتخاب روش مناسب برای استخراج کلمات کلیدی متن حائز اهمیت است. هدف پژوهش حاضر، مقایسه عملکرد سه رویکرد درکشف و استخراج کلیدواژه‌های موضوعی کتاب‌های الکترونیک با استفاده از تکنیک‌های متن‌کاوی و یادگیری ماشین است. در این راستا سه رویکرد آزمایشی شامل، 1) اجرای متوالی فرایند خوشه‌بندی، ارتقای کیفیت خوشه‌ها از نظر معنایی و غنی‌سازی کلمات توقف حوزه خاص، 2) استفاده از الگوی کلیدواژه‌های تخصصی، 3) استفاده از بخش‌های مهم متن در کشف و استخراج واژگان کلیدی و موضوعات مهم متن معرفی و مقایسه شده است. جامعه آماری شامل 1000 عنوان کتاب الکترونیک از زیرشاخه‌های موضوعی حوزه علم اطلاعات و دانش‌شناسی بر اساس نظام رده‌بندی کنگره است که بعد از کسب اطلاعات کتابشناختی آن از پایگاه کتابخانه کنگره، اقدام به تهیه متن اصلی گردید. استخراج کلیدواژه‌های موضوعی و خوشه‌بندی داده‌های آموزش به ‌کمک الگوریتم تجزیه نامنفی ماتریس و با سه رویکرد آزمایشی انجام شد و کیفیت و عملکرد خوشه‌های موضوعی حاصل از اجرای سه رویکرد در بخش دسته‌بندی خودکار داده‌های آزمایشی به ‌کمک ماشین بردار پشتیبان مقایسه شد. یافته‌ها نشان داد که افت همینگ (020/0) یا میزان خطا در دسته‌بندی صحیح متون آزمایشی در رویکرد سوم یعنی بهره‌گیری از بخش‌های مهم متن در استخراج کلیدواژه‌های موضوعی، از دو رویکرد دیگر کمتر است. همچنین امتیازF1  (82/0) که میانگین دو معیار دقت (87/0) و بازخوانی (78/0) و بازتابی از عملکرد درست فرایند دسته‌بندی در برچسب‌گذاری موضوعی متون است، در رویکرد سوم بهتر از نتایج دو رویکرد دیگر است. نتایج تحلیل‌ها نشان داد که کیفیت و انسجام معنایی خوشه‌های موضوعی حاصل از رویکرد سوم، یعنی استفاده از بخش‌های مهم متن در کشف و استخراج موضوع، در مقایسه با دو رویکرد دیگر بهتر بود. افزون ‌بر این، کلیدواژه‌های به‌دست‌آمده از خوشه‌های موضوعی رویکرد سوم را می‌توان در مجموعه‌های توصیف‌نشده و ناشناخته به‌منظور استخراج محتوای موضوعی ناآشکار کل مجموعه به‌کار برد.