بهبود الگوریتم RAKE برای استخراج کلیدواژه از متون علمی فارسی؛ مطالعه موردی: پایاننامهها و رسالههای فارسی
نویسندگان
1 دانشگاه صنعتی امیرکبیر
2 پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک)؛ تهران، ایران
3 دانشگاه صنعتی امیرکبیر؛ تهران، ایران
doi
10.52547/jipm.37.1.197چکیده
کلمات کلیدی زیرمجموعهای از کلمات یا عبارات یک سند هستند که میتوانند معنای سند را توصیفکنند و در فرایند بازیابی اطلاعات نقش مهمی ایفا کنند. از آنجا که عملیات استخراج کلیدواژه یا عبارات کلیدی از متون تخصصی و علمی کاری تخصصی و زمانبر بوده و حجم اسناد علمی که نیاز به کلیدواژه دارند روزافزون است، الگوریتمهای مختلفی برای استخراج تخصصی و خودکار کلیدواژه و عبارات کلیدی به اسناد طراحی و پیادهسازی شدهاند. RAKE یک الگوریتم پرکاربرد برای استخراج کلمات کلیدی از متون است. اساس کار الگوریتم RAKE، کلمات کلیدی و عموماً حاوی چندین کلمه (یعنی عبارت کلیدی) هستند، ولی علائم نگارشی یا کلمات بیمعنا یا ایستواژهها را شامل نمیشوند. در این الگوریتم از برچسبگذاری دستوری کلمات بهعنوان ابزاری برای تعیین ضریب اهمیت آنها در جملات استفاده میشود. کلیدواژهها مجموعهای از توالیهای چندکلمهای یا تککلمهای هستند که طبق معیارهای خاصی امتیازدهی میشوند. در این پژوهش، یک نسخه بهبودیافته از الگوریتم استخراج خودکار کلیدواژه (RAKE) ارائه شده است. در نسخه بهبودیافته سعی شده با ایجاد تغییراتی در معیارهای امتیازدهی عبارات کاندید، دقت و بازخوانی عبارات کلیدی استخراجشده افزایش یابد. راهکار ارائهشده برای بهبود الگوریتم RAKE با در نظر گرفتن ضعفهای موجود در رویکردهای وزندهی دراین الگوریتم بهویژه برای زبان فارسی و مستندات علمی پیشنهاد شده است. برای بررسی نقاط ضعف الگوریتم RAKE و ارائه راهکار پیشنهادی از مجموعهای از فرادادههای پایاننامه و رسالههای فارسی استفاده شده است. راهکار پیشنهادی روی این دادهها آزمایش و ارزیابی شده و باعث افزایش دقت، بازخوانی و معیار F شده است.