طراحی و ضبط پایگاه‌دادگان گفتاری برای سیستم‌های تبدیل متن به گفتار فارسی

نویسندگان

1 استادیار گروه زبان انگلیسی دانشگاه شهرکرد

2 پژوهشگر/دانشگاه صنعتی شریف

3 استاد/پژوهشگاه علوم انسانی و مطالعات فرهنگی

4 استاد/دانشگاه صنعتی سریف

5 استاد/دانشگاه تهران

doi
10.22084/rjhll.2016.1728
چکیده

مقالة حاضر به ارائة روشی برای طراحی و ساختِ پایگاه‌دادگانی مختص سیستم‌های تبدیل متن به گفتار با در نظر گرفتن ساخت نوایی فارسی می‌پردازد. این مجموعه به لحاظ آوایی و نوایی غنی و مشتمل بر 2826 نمونه جملة فارسی است. این نمونه جملات در شرایط استودیو و با تک‌صدای گویندة خانم که به صورت حرفه‌ای در زمینة صدا فعالیت می‌کند ضبط شده است. پوشش حالت‌های مختلف نوایی در کنار پوشش حالت‌های مختلف آوایی از نقاط قوت این پایگاه است که برای نخستین بار در سیستم‌های تبدیل متن به گفتارِ فارسی لحاظ می‌شود. این مجموعه در کنار فایل‌های صوتی، دارای برچسب‌های متن و صورت آوایی است که به صورت دستی اصلاح شده‌‌اند. در نهایت، با بکارگیری مجموعه دادگان مذکور و با استفاده از روش بازسازی گفتار آماری ـ پارامتری ساخت صدا انجام گرفت. آزمودنی‌ها کیفیت صدای ساخته‌شده را با استفاده از معیار میانگینِ امتیازاتِ نظردهی (MOS) 4.3 ارزیابی کردند.