بازشناسی و مرتبط‌سازی موجودیت‌های نام‌دار در سند احادیث

نویسندگان

1

2 دانشگاه آیت الله العظمی بروجردی

doi
10.22034/csj.2024.209868
چکیده

مسئلة بازشناسی موجودیت‌های نام‌دار در متنی از یک زبان طبیعی، این نیازمندی است که درون متن، بخش‌هایی که حاوی اسامی خاص هستند را پیدا کنیم. علاوه بر این، مرتبط‌سازی این موجودیت‌های نام‌دار عبارتست از این که برای هر اسم خاص مشخص شده درون آن متن، مقصود یا مدلول آن اسم در جهان واقع را مشخص کنیم به گونه‌ای که اسامی یکسان یا مشابه اما با مدلول‌های متفاوت، کاملا از یکدیگر متمایز شوند. در این مقاله، شیوه بازشناسی موجودیت‌های نام‌دار در سند احادیث و هم‌چنین مرتبط‌سازی این اسامی با شناسة منحصربه‌فرد افراد تشریح می‌شود. بازشناسی با استفاده از آموزش مدل پیش‌آموختة AraBERTv02 روی دادگان CANERCorpus صورت می‌گیرد که با تخصیص دادگان به نسبت 8/0 به 2/0 برای دادگان آموزش و آزمون، میزان دقت (accuracy) مساوی 990/0 در دسته‌بندی صحیح کلمات متعلق به دستة اشخاص حاصل می‌شود. مرتبط‌سازی با استفاده از روش‌های یادگیری مبتنی بر گراف انجام می‌شود. با مدل کردن یک دسته از سند احادیث به صورت یک گراف (در واقع یک جنگل) که سند هر حدیث به صورت یک درخت از گره‌هایی است که متناظر با افراد هستند، می‌توان مسئله را به صورت پیش‌بینی برچسب برای گره‌ها تعریف کرد. به این ترتیب یک شبکة هم‌آمیخت گرافی (GCN) معرفی می‌شود که سعی دارد تا این برچسب را براساس شکل ظاهری افراد پیرامونی هر فرد پیش‌بینی کند. این شبکه می‌تواند با آموزش روی 8/0 از دادگان، به دقت میزان دقت (accuracy) مساوی 8570/0 برسد.