تحلیل توزیع و تمرکز کلیدواژههای پارساها: میزان تطابق با توصیفگرها، عنوان، و چکیده
نویسندگان
1 پژوهشگاه علوم و فناوری اطلاعات ایران(ایرانداک)
2 پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک)؛ استادتمام دانشگاه بوعلیسینا؛ دانشکده مهندسی؛ گروه برق؛
doi
10.35050/JIPM010.2018.015چکیده
نمایهها و چکیدههای یک متن خلاصهای از متن را در اختیار خواننده قرار میدهند. پس، میتوان از آنها برای درک سریع و بازیابی سند استفاده کرد. از آنجا که بخش عمدهای از فعالیتهای علمی فارسی در کشور ایران را پارساها تشکیل میدهند، در این پژوهش نمایهسازی پارساها از دو دیدگاه نویسنده پارسا و نمایهساز حرفهای مورد بررسی قرار خواهد گرفت. سپس، این نمایهها با عنوان پارساها مورد بررسی قرار میگیرند تا میزان انطباق با کلیدواژههای عنوانی بهدست آید. از سوی دیگر، با بررسی کلی مجموعهای از نمایهها و چکیدهها علاوه بر قابلیت بهبود در بازیابی اطلاعات برای محقق، حوزه فعالیتی که بیشتر اسناد بر روی آن تمرکز کردهاند، مشخص میشود. علاوه بر آن، در این پژوهش وجود نمایهها و توزیع آنها در چکیده بررسی میشود. از توزیع کلیدواژهها در چکیده میتوان در استخراج خودکار کلیدواژهها از چکیده پارساها در کارهای آتی استفاده نمود. این پژوهش بر روی پارساهای موجود در پایگاه داده «پژوهشگاه علوم و فناوری اطلاعات ایران» که منبع گردآوری پارساهای فارسی است، انجام شده است. روش پژوهش به این صورت است که بعد از گردآوری دادهها، پارساهایی که اطلاعات کافی ندارند، پالایه شده و بقیه «پارساها» توسط برنامهای که برای پردازش متن چکیده و نمایههای پارساها نوشتهایم، مورد تحلیل قرار خواهند گرفت. سپس، اطلاعات بهدستآمده با استفاده از آمار توصیفی شرح داده خواهد شد. بررسی انجامشده در این پژوهش نشان داده است که عموماً نمایههای انتخابشده (بیش از 60 درصد) توسط نویسنده و نمایهساز حرفهای از 40 درصد ابتدایی چکیده انتخاب شدهاند. دیگر تحلیلهای آماری این پژوهش نشان میدهند که میزان انطباق بین توصیفگرها و کلیدواژهها 8 درصد است. این اختلاف نشاندهنده میزان تفاوت نظر زیاد بین نویسندگان پارساها و نمایهسازان است. با بهرهگیری از این اختلاف و با تجمیع کلمات و غنیکردن کلیدواژههای سیستم بازیابی اطلاعات میتوان در بهبود بازیابی اطلاعات نیز استفاده کرد.