تشخیص خودکار گوینده مبتنی بر ویژگی های استخراج شده از بانک فیلتر گابور و شبکه های عصبی کانولوشنال

نویسندگان

1 گروه مهندسی برق، دانشکده مهندسی، دانشگاه لرستان، خرم آباد، ایران

2 گروه مهندسی کامپیوتر، دانشکده مهندسی، دانشگاه لرستان، خرم آباد، ایران

3 گروه مهندسی برق، دانشکده فنی و مهندسی ، دانشگاه یاسوج، یاسوج، ایران

doi
10.22075/jme.2022.26690.2245
چکیده

صدای یک انسان حاوی خصوصیاتی از قبیل: قومیت، جنسیت، احساس، سن و اطلاعات دیگری از فرد است و موضوع تشخیص گوینده به شناسایی هویت افراد بر اساس صدای آنها می‌پردازد. اگرچه محققان در طول سال‌های گذشته در این زمینه فعالیت داشته‌اند و روش‌هایی برای بهبود دقت تشخیص گوینده پیشنهاد داده‌اند اما هنوز چالش‌هایی در این زمینه وجود دارد. در این مقاله یک روش جدید تشخیص گوینده مبتنی بر فیلترهای گابور و شبکه‌های عصبی کانولوشنال ارایه شده است. در روش پیشنهادی، ابتدا اسپکتروگرام سیگنال صحبت فرد تشکیل می‌شود. سپس با طراحی موثر فیلترهای گابور، بانک فیلتر گابور ایجاد می‌گردد. در مرحله‌ی بعد اسپکتروگرام سیگنال از بانک فیلتر گابور عبور داده شده و ویژگی‌های سیگنال صحبت استخراج می‌شود. در مرحله‌ی آخر با استفاده از یک شبکه‌ی عصبی کانولوشنال، گوینده شناسایی می‌شود. برای ارزیابی روش پیشنهادی از دو پایگاه داده‌ی Aurora2 و TIMIT استفاده شده است. نتایج نشان می‌دهد که روش پیشنهادی دقت بهتری نسبت به روش‌های پیشین دارد.