استخراج ویژگیهای متنی و معنایی در یادگیری رتبهبندی جهت بازیابی اسناد وب
نویسندگان
1 دانشکده مهندسی؛ گروه کامپیوتر؛ دانشگاه فردوسی مشهد؛ مشهد، ایران؛
2 گروه مهندسی برق کامپیوتر و بیومدیکال؛ دانشگاه رایرسون، کانادا؛
3 مهندسی کامپیوتر؛ دانشگاه نیوبرانزویک، کانادا
4 دانشکده مهندسی؛ گروه کامپیوتر؛ دانشگاه فردوسی مشهد؛ ایران؛
5 دانشکده مهندسی؛ دانشگاه فردوسی مشهد؛ مشهد، ایران؛
doi
10.52547/jipm.36.4.1081چکیده
با ظهور وب معنایی، تعریف و استفاده از ویژگیهای معنایی در الگوریتمهای یادگیری رتبهبندی هم مطرح شده است. یک چالش مهم در این زمینه عدم استفاده از ویژگیهای جامع و همچنین، عدم ترکیب کامل از ویژگیهای متنی و معنایی است. در این مقاله، با تعریف ویژگیهای معنایی جدید در چهار دسته ویژگیهای مبتنی بر گراف و پایگاه دانش، ویژگیهای مبتنی بر تکرار موجودیت، ویژگیهای مبتنی بر فیلدهای متنی، و ویژگیهای مبتنی بر نمایش برداری کلمات و متون به این چالش پاسخ داده شده است. جهت ارزیابی از مجموعه داده MQ-2007 متعلق به LETOR4، که حاوی ویژگیهای متنی آماده است، و شش الگوریتم یادگیری رتبهبندی استاندارد استفاده شده است. نتایج تجربی نشان میدهد که ویژگیهای معنایی و نیز ترکیب آنها با ویژگیهای متنی باعث بهبود ۵۰ درصدی نسبت به استفاده از تنها ویژگیهای متنی میشوند. در انتها، از یک الگوریتم انتخاب ویژگی برای انتخاب بهترین ویژگیهای معنایی استفاده شده که منجر به بهبود ۷ درصدی نسبت به الگوریتمهای رتبهبندی بدون انتخاب ویژگی شده است.