شناسایی و استخراج باهمایی های زبان فارسی با استفاده از روش های رایانشی
نویسندگان
1 دانشیار:دانشکده علوم و فنون نوین، دانشگاه تهران، تهران، ایران
2 استادیار؛ دانشکده سامان ههای هوشمند؛ دانشگاه تهران
3 دانشآموخته دانشکده علوم و فنون نوین، دانشگاه تهران
4 استاد؛ دانشکده ادبیات و علوم انسانی؛ دانشگاه تهران
doi
10.22034/jipm.2024.2030932.1646چکیده
در این مقاله به بازشناسی باهماییها در زبان فارسی پرداخته میشود. پژوهشهای صورتگرفتة زبان فارسی در این زمینه عمدتاً آماری و مقابلهای بوده است. هدف این پژوهش بازشناسی باهماییها به روش پیکرهبنیاد و رایانشی است. برای این منظور از پایگاه داده زبان فارسی بهعنوان پیکره پژوهش استفاده شده است. همچنین بهعلت نداشتن لغتنامة باهماییها در زبان فارسی مجموعه دادهای از باهمایی بر اساس کتاب فرهنگ زبانآموز پیشرفته فارسی ساخته شده است. با استفاده از بردارهای تعبیة fasttext مدل زبانی با شبکة حافظه کوتاهمدت ماندگار آموزش داده میشود. همچنین با تنظیم دقیق «پارسبرت» فراخوانی این مدل زبانی با استفاده از لیستهای هزارتایی باهماییها و ناباهماییها محاسبه شد. در انتها، بررسی مقابلهای بازشناسی باهمایی در موتور ترجمه گوگل با استفاده از ترجمه هزار جمله فارسی به انگلیسی که هر یک از جملات دارای یک باهمایی است، انجام شد. نتایج نشان میدهد که مدل «پارسبرت» با فراخوانی 93/95 درصد و 8/85 درصد بهترتیب، به بازشناسی باهمایی و ناباهمایی و مدل زبانی آموزشدیده با شبکة حافظه کوتاهمدت ماندگار بهترتیب باهمایی و ناباهمایی را با فراخوانی 6/6 درصد و 0 درصد بازشناسی کرد. همچنین بررسی مقابلهایِ دقت ترجمه موتور گوگل در ترجمه باهماییها سه نتیجه را دربرداشت: 1) باهمایی بهدرستی بازشناسی و ترجمه شد، 2) باهمایی بهدرستی بازشناسی نشد و ترجمه بهصورت تحتاللفظی و واژهبهواژه است، و 3) باهمایی بازشناسی نشد و ترجمة غلطی صورت پذیرفته است.