معماری سامانه گراف دانش زبان فارسی

نویسندگان

1 دانشکده کامپیوتر؛ دانشگاه علم و صنعت ایران

2 دانشکده کامپیوتر؛ واحد تهران مرکزی؛ دانشگاه آزاد اسلامی؛ تهران، ایران

doi
10.35050/JIPM010.2020.057
چکیده

گراف دانش به‌‏عنوان یکی از بسترهای مهم جهت ورود به عرصه‏ وب معنایی و توسعه ابزارهای پردازش زبان طبیعی شناخته می‏‌شود. تاکنون پایگاه‏‌های دانش مختلفی در زبان‏‌های گوناگون ایجاد شده است، اما فقدان چنین پایگاهی در کاربردهای پژوهشی و صنعتی که به زبان فارسی اختصاص داشته باشد، کاملاً مشهود است. در این مقاله جامع‏ترین پایگاه دانش زبان فارسی به‏‌صورت عمومی و چنددامنه‏‌ای مشتمل بر 500 هزار موجودیت و 7 میلیون رابطه میان آن‏ها با عنوان «فارس‏بیس» ارائه می‏‌گردد که به‏‌صورت متن باز در دسترس است. منابع اطلاعاتی «فارس‏بیس» عبارت‏اند از: اطلاعات ساخت‏‌یافته «ویکی‏‌پدیا» مانند جعبه‏‌های اطلاعاتی، جداول وب و همچنین اطلاعاتی که توسط ماژول استخراج‏‌گر رابطه از متن خام استخراج شده‏‌اند. موجودیت‏‌های گراف دانش در یک هستان‏‌شناسی برگرفته از «دی‏بی‏‌پدیا» و سفارشی‏‌شده برای «فارس‏بیس»، سازماندهی شده است. به‏‌منظور پیوند جعبه‏‌های اطلاعاتی «ویکی‏‌پدیا» به هستان‏‌شناسی بیش از 7000 نگاشت میان الگوها و خصیصه‏‌های «ویکی‏‌پدیا» با هستان‏‌شناسی برقرار شده است. همچنین، با روش‏‌های یادگیری ماشین و با نظارت خبرگان، قسمتی از هستان‏‌شناسی و تعدادی از موجودیت‏‌ها به «فارس‏نت» متصل شده‏‌اند. مدل داده‏ای گراف دانش فارسی بر اساس استاندارد وب معنایی و به‏‌صورت RDF پیاده‏‌سازی شده است. بنابراین، داده‌‏ها به‏‌صورت سه‏‌تایی در پایگاه دانش ذخیره شده و می‏‌توان از طریق زبان پرس‌‏وجوهای معنایی را بیان نمود. در حال حاضر، اطلاعات متنوعی به‌‏صورت ساخت‏‌یافته راجع به اشخاص مشهور، مکان‏‌های مهم، سازمان‌‏ها و شرکت‏‌ها، آثار ادبی و هنری، گونه‏‌های زیستی شامل گیاهان و حیوانات، رویدادها، زیست‏‌شناسی و اخترشناسی در این گراف قابل دسترسی است. به‏‌منظور خدمت‏‌رسانی به موتورهای جست‏وجو یک سامانه جست‏‌وجو روی موجودیت‏‌ها و گزاره‏‌های آن پیاده‏‌سازی شده است. «فارس‏بیس» از چهار جنبه صحت، فراخوانی، پوشش، و تازگی اطلاعات مورد ارزیابی قرار گرفته که نتایج به‏‌دست آمده حکایت از غنی بودن آن دارد. ‏بستر گراف دانش می‏‌تواند در کاربردهای بسیاری نظیر موتورهای جست‏‌وجو، سامانه پرسش و پاسخ، بازیابی اطلاعات، پردازش زبان طبیعی، تشخیص موجودیت، مشابهت‏‌یابی متن و هر کاربردی که نیازمند موجودیت‏‌های فارسی و ارتباط میان آن‏‌هاست، مورد استفاده قرار گیرد.