بازشناسی و مرتبطسازی موجودیتهای نامدار در سند احادیث
نویسندگان
1
2 دانشگاه آیت الله العظمی بروجردی
doi
10.22034/csj.2024.209868چکیده
مسئلة بازشناسی موجودیتهای نامدار در متنی از یک زبان طبیعی، این نیازمندی است که درون متن، بخشهایی که حاوی اسامی خاص هستند را پیدا کنیم. علاوه بر این، مرتبطسازی این موجودیتهای نامدار عبارتست از این که برای هر اسم خاص مشخص شده درون آن متن، مقصود یا مدلول آن اسم در جهان واقع را مشخص کنیم به گونهای که اسامی یکسان یا مشابه اما با مدلولهای متفاوت، کاملا از یکدیگر متمایز شوند. در این مقاله، شیوه بازشناسی موجودیتهای نامدار در سند احادیث و همچنین مرتبطسازی این اسامی با شناسة منحصربهفرد افراد تشریح میشود. بازشناسی با استفاده از آموزش مدل پیشآموختة AraBERTv02 روی دادگان CANERCorpus صورت میگیرد که با تخصیص دادگان به نسبت 8/0 به 2/0 برای دادگان آموزش و آزمون، میزان دقت (accuracy) مساوی 990/0 در دستهبندی صحیح کلمات متعلق به دستة اشخاص حاصل میشود. مرتبطسازی با استفاده از روشهای یادگیری مبتنی بر گراف انجام میشود. با مدل کردن یک دسته از سند احادیث به صورت یک گراف (در واقع یک جنگل) که سند هر حدیث به صورت یک درخت از گرههایی است که متناظر با افراد هستند، میتوان مسئله را به صورت پیشبینی برچسب برای گرهها تعریف کرد. به این ترتیب یک شبکة همآمیخت گرافی (GCN) معرفی میشود که سعی دارد تا این برچسب را براساس شکل ظاهری افراد پیرامونی هر فرد پیشبینی کند. این شبکه میتواند با آموزش روی 8/0 از دادگان، به دقت میزان دقت (accuracy) مساوی 8570/0 برسد.