ارائه مدلی ترکیبی مبتنی بر CNN – LSTM جهت تشخیص هیجان از سیگنال گفتار
نویسندگان
1 کارشناسی ارشد،دانشگاه جامع امام حسین (ع)، تهران،ایران
2 پژوهشگر،دانشگاه جامع امام حسین (ع)، تهران،ایران
3 کارشناسی ارشد،دانشگاه جامع امام حسین (ع)، تهران،ایران
doi
چکیده
داده های منتشرشده در فضای مجازی شامل متن، تصویر، ویدئو و صوت به منبعی معتبر برای سنجش افکار، عقاید و هیجانات مخاطب نسبت به اشیا مختلف مانند دولتها، سیاستها، شخصیتها، محصولات و غیره تبدیلشدهاند، ب همنظور مقابله با تهدیدات شناختی فضای سایبری، تشخیص شاکله شناختی مخاطبان خودی و غیرخودی بسیار حائز اهمیت است. پژوهش حاضر بهمنظور ارائهی مدلی محاسباتی برای تشخیص هیجان گفتار مخاطب مبتنی بر ترکیب دوطبقه بند CNN – LSTM صورت گرفته است. در این مقاله در ابتدا مقدمهای در مورد تشخیص هیجان گفتار و کاربردهای آن گفتهشده، سپس طرحهای ارائهشده در مجلات معتبر مرور و دقت آنها ارزیابیشده است، در ادامه روشی کاربردی جهت تشخیص هشت هیجان پایه مخاطب شامل شادی، غم، ترس، آرام، خشم، نفرت، شگفتزده و خنثی ارائهشده است. در این پژوهش بهمنظور داشتن تعداد داده بالا، با ترکیب دو مجموعه داده RAVDESS و TESS یک مجموعه داده کلی جمعآوریشده، در مرحله استخراج ویژگی سه ویژگی MFCC، MEL و ZCR استخراج و ترکیبشده و سپس در مدل طراحیشده از ترکیب طبقهبندی کنندههای CNN و LSTM جهت آموزش و تست استفادهشده است. با ارزیابیهای انجامشده، دقت مدل بر رویدادههای تست، 92.57 درصد است، که نسبت به مدل های موجود دارای دقت بالاتری می باشد.