استخراج هوشمند مرز فراداده و متن در پایاننامههای فارسی با رویکرد BA_SVM
نویسندگان
1 دانشگاه الزهرا (س)؛ تهران، ایران؛
2 پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک)؛ تهران، ایران؛
3 دانشگاه الزهرا (س)؛ تهران، ایران؛
doi
10.52547/jipm.36.4.1159چکیده
استخراج فراداده باعث تسهیل در فرایند نمایهسازی و بهبود در بازیابی اطلاعات است. از سوی دیگر، خودکارسازی این فرایند سبب افزایش کارایی نسبت به استخراج دستی فرادادههاست. نام دانشجو، نام اساتید، عنوان، رشته و مقطع تحصیلی، چکیده، و کلمات کلیدی نمونهای از فرادادههای پایاننامه است. هدف در این مقاله شناسایی خودکار مرز فراداده و بدنه اصلی در پایاننامههای فارسی است. بدین منظور، ۲۵۰ پایاننامه ثبتشده در سامانه «ایرانداک» جمعآوری شده است. ویژگیهای مد نظر از هر پاراگراف استخراج شده و سپس، پاراگرافهای پایاننامه با روش ماشین بردار پشتیبان به دو کلاس فراداده و بدنه طبقهبندی شد. در این پژوهش برای تنظیم پارامترهای الگوریتم ماشین بردار پشتیبان، الگوریتم فرامکاشفهای خفاش بهکار گرفته شده است. نتایج نشان میدهد که روش پیشنهادی با دقت ۹۶/۶ درصد نوع پاراگراف را تشخیص میدهد.