ارائه مدلی ترکیبی مبتنی بر CNN – LSTM جهت تشخیص هیجان از سیگنال گفتار

نویسندگان

1 کارشناسی ارشد،دانشگاه جامع امام حسین (ع)، تهران،ایران

2 پژوهشگر،دانشگاه جامع امام حسین (ع)، تهران،ایران

3 کارشناسی ارشد،دانشگاه جامع امام حسین (ع)، تهران،ایران

doi
چکیده

داده های منتشرشده در فضای مجازی شامل متن، تصویر، ویدئو و صوت به منبعی معتبر برای سنجش افکار، عقاید و هیجانات مخاطب نسبت به اشیا مختلف مانند دولتها، سیاستها، شخصیتها، محصولات و غیره تبدیلشدهاند، ب همنظور مقابله با تهدیدات شناختی فضای سایبری، تشخیص شاکله شناختی مخاطبان خودی و غیرخودی بسیار حائز اهمیت است. پژوهش حاضر به‌منظور ارائه‌ی مدلی محاسباتی برای تشخیص هیجان گفتار مخاطب مبتنی بر ترکیب دوطبقه بند CNN – LSTM صورت گرفته است. در این مقاله در ابتدا مقدمهای در مورد تشخیص هیجان گفتار و کاربردهای آن گفتهشده، سپس طرحهای ارائهشده در مجلات معتبر مرور و دقت آن‌ها ارزیابی‌شده است، در ادامه روشی کاربردی جهت تشخیص هشت هیجان پایه مخاطب شامل شادی، غم، ترس، آرام، خشم، نفرت، شگفت‌زده و خنثی ارائه‌شده است. در این پژوهش بهمنظور داشتن تعداد داده بالا، با ترکیب دو مجموعه داده RAVDESS و TESS یک مجموعه داده کلی جمع‌آوریشده، در مرحله استخراج ویژگی سه ویژگی MFCC، MEL و ZCR استخراج و ترکیب‌شده و سپس در مدل طراحی‌شده از ترکیب طبقه‌بندی کننده‌های CNN و LSTM جهت آموزش و تست استفاده‌شده است. با ارزیابیهای انجامشده، دقت مدل بر روی‌داده‌های تست، 92.57 درصد است، که نسبت به مدل های موجود دارای دقت بالاتری می باشد.