بازشناسی مقاوم گفتار با استفاده از شبکههای عصبی حافظه کوتاهمدت ماندگار و ویژگیهای گلوگاه
نویسندگان
1 دانشکده مهندسی کامپیوتر - دانشگاه صنعتی خواجهنصیرالدین طوسی
2 دانشکده مهندسی کامپیوتر - دانشگاه علم و صنعت
3 دانشکده مهندسی کامپیوتر - دانشگاه علم و صنعت
doi
چکیده
شبکههای عصبی عمیق در سالهای اخیر به طرز گستردهای در سیستمهای بازشناسی گفتار مورداستفاده قرارگرفتهاند. بااینوجود، مقاومسازی این مدلها در حضور نویز محیط کمتر موردبررسی قرارگرفته است. در این مقاله دو راهکار برای مقاومسازی مدلهای شبکه حافظه کوتاهمدت ماندگار نسبت به نویز جمعپذیر محیطی موردبررسی قرارگرفته است. راهکار اول افزایش مقاومت مدلهای شبکه حافظه کوتاهمدت ماندگار نسبت به حضور نویز است که با توجه بهخصوصیت این شبکهها در یادگیری رفتار بلندمدت نویز ارائه میشود. بدین منظور پیشنهاد میشود از گفتار نویزی برای آموزش مدلها استفاده شود تا بهصورت آگاه به نویز آموزش ببینند. نتایج روی مجموعه داده نویزی شده TIMIT نشان میدهد که اگر مدلها بهجای گفتار تمیز با گفتار نویزی آموزش ببینند، دقت بازشناسی تا 18 درصد بهبود خواهد یافت. راهکار دوم کاهش تأثیر نویز بر ویژگیهای استخراجشده با استفاده از شبکه خود رمزگذار کاهنده نویز و استفاده از ویژگیهای گلوگاه بهمنظور فشردهسازی بردار ویژگی و بازنمایی سطح بالاتر ویژگیهای ورودی است. این راهکار باعث میشود مقاومت ویژگیها نسبت به نویز بیشتر شده و درنتیجه دقت سیستم بازشناسی پیشنهادشده در راهکار اول، در حضور نویز 4 درصد افزایش یابد.