به‌کارگیریِ اطلاعاتِ زبانی در یک سیستمِ بازشناسیِ گفتار پیوستة فارسی

نویسندگان

1 دانشگاه صنعتی شریف( آزمایشگاه پردازش گفتار)

2 دانشگاه صنعتی شریف( آزمایشگاه پردازش گفتار)

doi
چکیده

در این مقاله یک سامانۀ بازشناسی گفتار پیوسته برای زبان فارسی معرفی می‌شود و نقش مدل آوایی و مدل زبانی در آن مورد بررسی قرار می‌گیرد. مدل‌های آوایی با روش‌های مستقل‌از‌بافت و وابسته‌به‌بافت در این سامانه به‌کار رفته و نتایجِ به‌کارگیریِ آن‌ها ارائه شده است. مدل زبانیِ سه‌کلمه‌ای نیز با روش‌های مبتنی‌بر کلمه، مبتنی‌بر مقولة نحوی و مبتنی‌بر طبقه، با استفاده از پیکرۀ متنیِ زبانِ فارسی استخراج و در سامانۀ بازشناسی به‌کار گرفته شده است. همچنین مدل زبانیِ دستوری مبتنی‌بر دستور ساخت- گروهیِ تعمیم‌یافته در این سامانه پیاده‌سازی شده و نیز در ترکیب با مدل زبانیِ آماری به‌کار رفته است.  نتایج حاصل نشان می‌دهد که مدل آواییِ وابسته به بافت، مطابق انتظار، بهترین عملکرد را دارد. همچنین مدلِ زبانیِ سه‌کلمه‌ایِ مبتنی بر کلمه، نسبت به سایر روش‌های استخراجِ مدلِ زبانیِ آماری برتری دارد. درضمن ترکیبِ مدلِ زبانیِ دستوری با مدلِ زبانیِ آماری منجر به بهبودِ نتایجِ بازشناسی می‌شود. سامانۀ بازشناسیِ گفتارِ معرفی‌شده در این مقاله، اولین سامانۀ بازشناسی برای گفتارِ پیوستة فارسی بوده و با پشتوانۀ فعالیت‌های تحقیقاتیِ متعددی که برای پیاده‌سازیِ آن انجام شده است، قابلیت استفاده به‌صورت کاربردی را یافته است.