مقایسه روش‌های کلاسیک و روش‌های مبتنی بر اندازه‌های آماری پیکره‏بنیاد در استخراج خودکار واژه‌های پایه علوم پزشکی به روش بسامدی

نویسندگان

1 دانشجوی زبان‏شناسی همگانی، دانشگاه پیام نور، ایران.

2 دانشیارگروه زبان‏شناسی همگانی، دانشگاه پیام نور، ایران.

3 دانشیارگروه زبان‏شناسی همگانی، دانشگاه پیام نور ، ایران.

doi
10.30479/jtpsol.2019.9257.1393
چکیده

طی دو دهه‌ی اخیر با پیشرفت علم و فناوری، استفاده از‌‌‌ روش‌های پیکره­بنیاد در آموزش زبان و تدوین منابع درسی گسترش چشمگیری داشته است. پژوهش حاضر با هدف دستیابی به روشی خودکار در استخراج واژه از پیکره‌ها در زبان فارسی صورت گرفته است. برای دستیابی به هدف پژوهش روش‌های بسامد‌‌شماری در دو گروه کلاسیک و روش‌های مبتنی بر اندازه‌های آماری موردبررسی قرارگرفته و توانمندی هریک از که عبارتند از بسامدشماری پیکره‌‌ی عمومی، بسامدشماری پیکره‌ی تخصصی و روش‌های بهبودیافته‌ی آن‌ها موردمقایسه قرارمی گیرند. نتایج نشان می‌دهد که در روش‌های کلاسیک با اعمال تکنیک‌هایی می‌توان فرایند انتخاب واژه‌های تخصصی را بهبود بخشید و در این میان بهترین عملکرد مربوط به روش بسامدشماری بهبود‌یافته در پیکره­ی تخصصی بوده است. روش‌های به­کاررفته در پژوهش عبارتند از اطلاعات متقابل نقطه­ای و مجذور کا[1]. نتایج به­دست آمده برای این دو روش نیز قابلیت استفاده از روش‌های بسامدشماری پیکره­بنیاد در زبان فارسی را مورد تأیید قرار می‌دهد. روش مجذور کا با استخراج %۳۲ واژه­ی تخصصی و روش اطلاعات متقابل نقطه­ای با استخراج %52 واژه­ی تخصصی، عملکرد مناسبی در تشخیص خودکار واژه‌های تخصصی از خود نشان می‌دهند. نتایج حاصل از اعمال این روش‌ها روی پیکره‌ها و مقایسه آن­ها نشان می­دهند که  می‌توان از روش‌های مبتنی بر اندازه­گیری‌های آماری برای استخراج خودکار واژه در زبان بهره جست و به این ترتیب تحولی نوین در تهیه و تدوین متون آموزشی حاصل خواهد شد و آموزش‌دهندگان می‌توانند به فهرست واژگانی دسترسی داشته باشند که دانستن آن برای زبان آموزانشان مفید و گاه ضروری است.