فاجیک: مدل شبکه عصبی ژرف کدگذار-کدگشای و منابع زبانی مرتبط برای نویسهگردانی میان تاجیکی و فارسی
نویسندگان
1 دانشجوی کارشناسی ارشد، دانشگاه صنعتی شریف، گروه هوش مصنوعی، دانشکده مهندسی کامپیوتر آزمایشگاه علوم داده و یادگیری ماشین
2 استاد دانشگاه صنعتی شریف، گروه هوش مصنوعی، دانشکده مهندسی کامپیوتر آزمایشگاه علوم داده و یادگیری ماشین
3 علوم و تکنولوژیهای کاربردی، دانشگاه کالیفرنیا برکلی آزمایشگاه پردازش هوشمند متن و زبان و علوم انسانی محاسباتی. گروه هوش مصنوعی
doi
10.30465/lsi.2023.43449.1639چکیده
زبان تاجیکی، یا به شکل درستتر گویش تاجیکی زبان فارسی، از گونههای زنده زبان فارسی است که در کشور تاجیکستان رواج دارد. مهمترین تفاوت فارسی رایج در ایران با فارسی تاجیکی در سیستم نوشتار است که این تفاوت سبب ایجاد گسست فرهنگی میان دو ملتی که گفتار هم را متوجه می شوند، شده است. ساخت سامانهای برای تبدیل این دو نوشتار می تواند به نزدیکتر کردن این دو ملت کمک شایان ذکری کند. در گذشته تلاشهایی برای ساخت نویسهگردان رایانشی بین این دو گونه نوشتار صورت گرفته است. این سامانهها با استفاده از روشهای سنتی و قانونمحور این کار را انجام میدادند و برای همین خطاهای قابل توجهی در خروجی خود دارند. در این پژوهش تلاش شده است که با کمک روشهای یادگیری ژرف این نویسهگردانی انجام شود. در دهه گذشته این روشها تحول عظیمی در زبانشناسی رایانشی ایجاد کردهاند. در این پژوهش ابتدا پیکره موازی میان فارسی و تاجیکی جمعآوری شده است. سپس با کمک مدلهای رشته به رشته یک سامانه نویسهگردانی با عملکرد بهتر نسبت به سامانههای گذشته ایجاد شده است.