توسعه سیستم پیشنهاددهنده بر مبنای استدلال نمونه محور برای نمایهسازی مستندات علمی فارسی
نویسندگان
1 پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک) ،تهران ، ایران
2 پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک)؛ تهران، ایران
3 پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک)؛ تهران، ایران
doi
10.22034/jipm.2023.704737چکیده
استخراج کلیدواژه یکی از مهمترین قدمهای فرآیند نمایهسازی مستندات است. کلیدواژهها توصیفگرهای مفهومی هستند که میتوانند در جستجو و بازیابی اطلاعات و نیز اشاعه آنها بکارگرفته شوند. در پایگاههای دربردارنده اسناد علمی مانند پایگاه علمی گنج پژوهشگاه علوم و فناوری اطلاعات ایران، کلیدواژهها نقش مهمتری دارند و تخصیص کلیدواژههای تخصصی چالشبرانگیزتر است چرا که این پایگاهها دربرگیرنده اسناد تخصصی با حوزههای علمی مختلفی هستند. فرآیند نمایه-سازی دستی بسیار زمانبر است و با توجه به افزایش حجم تولید و ثبت مستندات علمی، نیاز است که این فرایند با سرعت بیشتری صورت گیرد. لذا استفاده از روشهای ماشینی هوشمند برای پیشنهاد و تخصیص کلیدواژه ضروری است. تحلیل آماری و معنایی اسناد و استفاده از روشهای یادگیری ماشین از جمله روشهای پرکاربرد در بسیاری از پایگاههای اطلاعات علمی دنیا است. بر همین اساس، در این پژوهش روشی برای پیشنهاد کلیدواژه به مستندات علمی فارسی بر مبنای روشهای هوشمند پردازش متن و یادگیری ماشین ارائه شده است. این روش بر مبنای سیستمهای پیشنهاددهنده و استدلال نمونهمحور است که براساس آن، مجموعهای از کلیدواژههای مرتبط با یک سند به نمایهساز پیشنهاد میشود تا او سریعتر بتواند کلیدواژههای مناسب را انتخاب کند. به بیانی دیگر، ابتدا اسناد مشابه با سند جدید براساس روشهای TFIDFو روشهای بازنمایی کلمه-به-بردار، بازیابی شده و سپس کلیدواژههای کاندید از بین اسناد مشابه براساس یک تابع رتبهبندی انتخاب میشوند. روش پیشنهادی بر مجموعهای از اسناد پایگاه گنج در سه حوزه فنی و مهندسی، هنر و ادبیات، و علوم انسانی، پیادهسازی و نتایج آن با معیارهایی نظیر دقت، فراخوانی و نظرات متخصصین ارزیابی شده است.