بررسی تکنیکهای بهبود عملکرد روشهای بسامدشماری پیکرهبنیاد در استخراج خودکار واژگان (مورد مطالعه: واژگان پایه علوم پزشکی)
نویسندگان
1 دانشگاه پیام نور، تهران، ایران
2 دانشگاه پیام نور، تهران، ایران
3 دانشگاه بین المللی امام خمینی، قزوین، ایران
4 دانشگاه پیام نور، تهران، ایران
doi
10.35050/JIPM010.2020.028چکیده
امروزه، شاهد گسترش استفاده از روشهای پیکرهبنیاد در زبانشناسی هستیم. پژوهش حاضر به بررسی تکنیکهای بهبود عملکرد روشهای بسامدشماری در زبان فارسی و با منظور دستیابی به رویه علمی جهت استخراج خودکار واژگان پایه علوم پزشکی انجام پذیرفته است. استفاده از روشهای آماری در کنار ابزار زبانشناسی پیکرهای (روشهای استخراج خودکار ترکیبی) جهت استخراج خودکار واژگان در تعدادی از زبانهای دنیا همچون انگلیسی، فرانسه، ژاپنی، و کرهای طی چند دهه اخیر بسیار رایج بوده است، حال آنکه این روشها در زبان فارسی تاکنون بهصورت جدی مورد استفاده قرار نگرفته و اغلب استخراجها در زبان فارسی به روش سنتی انجام گرفته است؛ ضمن آنکه بهکارگیری این روشها در هر زبانی متفاوت است و برونداد روشهای آماری در هر زمان با توجه به ویژگیهای زبانشناختی آن زبان متفاوت است. از این رو، باید مطابق با ویژگیهای هر زبان در این روشها تغییراتی اعمال کرد تا در نهایت، بتوان به روشی جهت استخراج خودکار واژگان دست یافت. جهت نیل به این هدف در زبان فارسی، از خانواده مدلهای بسامدشماری با رویکردهای بسامدشماری پیکره عمومی، بسامدشماری پیکره اختصاصی و روشهای بهبودیافته آنها استفاده شده است. بسامدشماری بهکاررفته در پژوهش، برپایه پردازش اطلاعات واژگان در دو پیکره اصلی و اختصاصی، که محقق آن را ایجاد کرده است و از این پس آن را پیکره محققساخته مینامیم، صورت گرفته است. پیکره محققساخته شامل متون درس زیستشناسی دوره اول تا چهارم دبیرستان، متون درس علوم دوم و سوم راهنمایی، متون تدریسشده در «مرکز آموزش زبان فارسی امام خمینی قزوین»، مجلات و مقالات حوزه پزشکی عمومی و پیکره عمومی مورد استفاده، پیکره روزنامه همشهری (نسخه دوم) است. نتایج بهدستآمده نشان میدهد که قابلیت استفاده از روشهای بسامدشماری پیکرهبنیاد در زبان فارسی برای دست یافتن به شیوهای واحد در استخراج خودکار واژگان وجود دارد. شیوه بهکارگیری روشهای آماری کلاسیک و مدرن و روشهای بهبودیافته آنها بهیقین میتواند گامی مؤثر در تهیه و تدوین متون آموزشی زبان فارسی و گسترش آموزش این زبان به شمار آید. از عمدهترین مشکلات استفاده از روشهای ساده، میتوان جداسازی واژگان پرتکرار، همچون حروف ربط را نام برد. بنابراین، جهت بالابردن توان این مدل با اعمال روشهایی میتوان روشهای اولیه را بهبود بخشید. مشاهده میشود که روش بسامدشماری بهبودیافته در پیکره اختصاصی از سایر روشها عملکرد بهتری داشته و تا 60 درصد واژگان تخصصی را در 50 واژه پربسامد شناسایی میکند. از سوی دیگر، مشاهده میشود که با افزایش دامنه واژگان مورد بررسی در پژوهش از 50 به 100، 150 و 200، دقت مدلها افزایش یافته و درصد واژگان تخصصی انتخابشده به ثبات میرسد.