تشخیص خودکار گوینده مبتنی بر ویژگی های استخراج شده از بانک فیلتر گابور و شبکه های عصبی کانولوشنال
نویسندگان
1 گروه مهندسی برق، دانشکده مهندسی، دانشگاه لرستان، خرم آباد، ایران
2 گروه مهندسی کامپیوتر، دانشکده مهندسی، دانشگاه لرستان، خرم آباد، ایران
3 گروه مهندسی برق، دانشکده فنی و مهندسی ، دانشگاه یاسوج، یاسوج، ایران
doi
10.22075/jme.2022.26690.2245چکیده
صدای یک انسان حاوی خصوصیاتی از قبیل: قومیت، جنسیت، احساس، سن و اطلاعات دیگری از فرد است و موضوع تشخیص گوینده به شناسایی هویت افراد بر اساس صدای آنها میپردازد. اگرچه محققان در طول سالهای گذشته در این زمینه فعالیت داشتهاند و روشهایی برای بهبود دقت تشخیص گوینده پیشنهاد دادهاند اما هنوز چالشهایی در این زمینه وجود دارد. در این مقاله یک روش جدید تشخیص گوینده مبتنی بر فیلترهای گابور و شبکههای عصبی کانولوشنال ارایه شده است. در روش پیشنهادی، ابتدا اسپکتروگرام سیگنال صحبت فرد تشکیل میشود. سپس با طراحی موثر فیلترهای گابور، بانک فیلتر گابور ایجاد میگردد. در مرحلهی بعد اسپکتروگرام سیگنال از بانک فیلتر گابور عبور داده شده و ویژگیهای سیگنال صحبت استخراج میشود. در مرحلهی آخر با استفاده از یک شبکهی عصبی کانولوشنال، گوینده شناسایی میشود. برای ارزیابی روش پیشنهادی از دو پایگاه دادهی Aurora2 و TIMIT استفاده شده است. نتایج نشان میدهد که روش پیشنهادی دقت بهتری نسبت به روشهای پیشین دارد.