ارائه روشی نوین برای استخراج خودکار چهریزهها در جستجوهای چهریزهای (مورد مطالعه: حوزه زنان و زایمان)
نویسندگان
1 دانشگاه شهید چمران اهواز؛ اهواز؛ ایران
2 دانشگاه شهید چمران اهواز، اهواز، ایران
3 دانشگاه شیراز؛ شیراز؛ ایران.
4 دانشگاه علوم پزشکی بوشهر؛ بوشهر؛ ایران.
doi
10.35050/JIPM010.2022.788چکیده
هدف این پژوهش ابداع و معرفی الگوریتمی نو برای استخراج چهریزههاست که امکان شناسایی تجربی چهریزهها را با کمک پشتوانه انتشاراتی فراهم میکند. الگوریتم پیشنهادی بر مبنای دو ایده شکل گرفته است: ایده اول اینکه چهریزه در بافت بروز پیدا میکند. بنابراین، برای تشخیص چهریزه در یک بدنه متنی بایستی بافت یا بستر آن مورد بررسی قرار گیرد و ایده دوم این است که چهریزه نقطه تمرکز در یک درخت واژگانی است که نه بسیار عام و نه بسیار خاص است. در حوزه پزشکی، دامنه زنان و زایمان بهعنوان بستر آزمون انتخاب گردید. سه پیکره متنی از درون پشتوانه انتشاراتی انتخاب شد. پیکره بستر، از چکیده و عنوان مجموعه مقالات موجود در ۲۰ مجله برتر حوزه انتخاب شد که دربرگیرنده ۱۶۷۰۷۱ سند بود. پیکره دوم، پیکره منشأ بود که ۲۰۰۰ مقاله بهصورت تصادفی از پیکره بستر انتخاب شد. پیکره سوم، پیکره واژگانی است که با استفاده از یک سرویس تحت وب و معیار رتبهبندی واژگان LIDF-value استخراج گردید. خروجی حاصل دربرگیرنده ۵۱۴ واژه بود. واژگان تکراری حذف شدند و سرانجام، ۴۸۰ واژه مهم شناسایی شد. سپس، واژگان در پیکره بستر با کمک مجموعه راهنما یعنی «مش» بسط داده شد و پس از آن، بر اساس دو شرط انتقال مبتنی بر تکرار یعنی بیشتر بودن اسناد مرتبط با واژه در بستر نسبت به منشأ و انتقال مبتنی بر رتبه یعنی رشد رتبه موجود واژه در پیکره بستر نسبت به منشأ که نشاندهنده عام شدن واژه است، چهریزههای کاندید استخراج شدند. سرانجام، با استفاده از سه قاعده اخص بودن، جایگزنی و اعم بودن، چهریزههای شناساییشده اصلاح و نامگذاری شدند. در نهایت، ۲۶ چهریزه بهعنوان چهریزههای حوزه زنان و زایمان شناسایی شدند. با مقایسه الگوریتم پیشنهادی با دیگر الگوریتمها مشخص شد که ایجاد سه افراز (افراز منشأ و بدنه متنی و افراز برای شناسایی واژگان مهم) و مقایسه رفتار واژه در آنها و سپس، ایجاد درخت بر اساس چهریزههای کاندید، یعنی ترکیب رویکرد آماری و هرس درخت میتواند نتایج مناسبتری نسبت به رویکرد صرفاً آماری یا هرس درخت داشته است. همچنین، مقایسه چهریزههای خروجی از الگوریتم و چهریزههای سنتی در این زمینه نشان داد که چهریزههای خروجی الگوریتم، خردتر و برای مرور در ابزارهای بازیابی اطلاعات مفیدتر هستند. همچنین، در این پژوهش مشخص شد که چهریزههای دامنه تخصصی از چهریزههای عمومی در حوزه پزشکی متفاوت است و مستقل از آنها قابل شناسایی و تعریف است، اما نمیتوان نتایج را به تمامی دامنههای پزشکی تعمیم داد و نیاز است که پژوهشهایی در دیگر حوزهها صورت گیرد.