معرفی و آزمون پیکره علیت PerCause برای شناسایی روابط علّی فارسی
نویسندگان
1 آزمایشگاه پردازش زبان طبیعی، دانشگاه شهید بهشتی، تهران، ایران
2 آزمایشگاه پردازش زبان طبیعی، دانشگاه شهید بهشتی، تهران، ایران
doi
10.35050/JIPM010.2022.036چکیده
شناسایی روابط علّی و همچنین تعیین مرز عناصر علّی در متن، از جمله مسائل چالش برانگیز در پردازش زبان طبیعی (NLP < /span>) به ویژه در زبانهای کممنبع مانند فارسی است. در این پژوهش، در راستای آموزش سیستمی برای شناسایی روابط علّی و مرز عناصر آن، یک پیکره علّیت برچسب خورده انسانی برای زبان فارسی معرفی میشود. این مجموعه شامل 4446 جمله (مستخرج از پیکره بیجن خان و متن یکسری کتاب) و 5128 رابطه علّی است و در صورت وجود، سه برچسب علت، معلول و نشانه علّی برای هر رابطه مشخص شده است. ما از این پیکره برای آموزش سیستمی برای تشخیص مرزهای عناصر علّی استفاده کردیم. همچنین، یک بستر آزمون شناسایی علّیت را با سه روش یادگیری ماشین و دو سیستم یادگیری عمیق مبتنی بر این پیکره ارائه میکنیم. ارزیابیهای عملکرد نشان میدهد که بهترین نتیجه کلی از طریق طبقهبندی کننده CRF به دست میآید که معیار F برابر 76% را ارائه میکند. علاوه بر این، بهترین صحت (91.4٪) در روش یادگیری عمیق BiLSTM-CRF به دست آمده است. به نظر میرسد وجود CRF به دلیل مدلسازی بافتار منجر به بهبود دقت سیستم میشود.