ترجمه ماشینی مبتنی بر مدل مبدل برای گویشهای لری بویراحمدی و یزدی به فارسی معیار و گسترش منابع زبانی رایانشی مرتبط
نویسندگان
1 1PhD. Student, Department of Computer Engineering, Sharif University of Technology, AI Group
2 دانشجوی دکتری، دانشگاه صنعتی شریف، دانشکده مهندسی کامپیوتر، گروه هوش مصنوعی
3 دانشیار، دانشگاه صنعتی شریف، دانشکده مهندسی کامپیوتر، گروه هوش مصنوعی
4 دانشیار، دانشگاه صنعتی شریف، دانشکده مهندسی کامپیوتر، گروه هوش مصنوعی
5 استاد، دانشگاه صنعتی شریف، دانشکده مهندسی کامپیوتر، گروه هوش مصنوعی
6 دانشجوی کارشناسی ارشد، دانشگاه صنعتی شریف، دانشکده مهندسی کامپیوتر، گروه هوش مصنوعی
7 پژوهشگر، دانشگاه صنعتی شریف، آزمایشگاه پردازش هوشمند متن و زبان، گروه هوش مصنوعی
8 دانشجوی کارشناسی، دانشگاه صنعتی شریف، دانشکده مهندسی کامپیوتر، گروه هوش مصنوعی
9 آزمایشگاه پردازش هوشمند متن و زبان و علوم انسانی محاسباتی
10 سایر
doi
10.30465/lsi.2024.43456.1640چکیده
با وجود تلاشهای گسترده رایانشی بر روی گویش معیار فارسی، سایر لهجهها و گویشها و زبانهای ایرانی کمتر مورد توجه محققین حوزه زبانشناسی رایانشی قرار گرفتهاند. یکی از مهمترین چالشهای کار رایانشی بر روی این تمایزهای زبانی، نبود یک مجموعه داده دیجیتال و استاندارد است. در این پژوهش اولین مجموعه داده تکزبانه و نیز داده موازی بر روی گویشهای لری و یزدی که گویشهایی با منابع محدود محسوب میشوند، در مقابل فارسی معیار ارائه شده است. در ادامه مدلهای یادگیری ژرف ترجمه ماشینی کدگذار-کدگشا در دو نوع مدل شبکه عصبی بازگشتی و مدل ژرف مبدل برای این گویشها به فارسی معیار توسعه یافته و ارزیابی گردیده است. در این پژوهش که اولین تلاش محاسباتی روی این دو گویش محسوب میشود، برای ترجمه لری به فارسی و فارسی به لری به امتیاز BLEU به ترتیب ۳۹/7 و 29/3 رسیدیم. این امتیاز برای گویش یزدی به فارسی معیار و برعکس به 73/0 و 77/0 رسید. که نشان میدهند پژوهشهای فراتری برای توسعه منابع زبانی برای این زبان نیاز است.