تشخیص گوینده با شبکه های عصبی کانولوشنال و تئوری نتروسافیک
نویسندگان
1 استادیار، دانشکده مهندسی، دانشگاه لرستان، خرم آباد، ایران
2 استادیار، دانشکده مهندسی، دانشگاه یاسوج،یاسوج، ایران
3 استادیار، دانشکده مهندسی، دانشگاه لرستان، خرم آباد، ایران
doi
10.22075/jme.2023.29933.2409چکیده
تشخیص گوینده، فرآیند تشخیص افراد بر اساس صوت آنها است که در کاربردهای زیادی مورد استفاده قرار میگیرد. اگرچه تاکنون تحقیقات زیادی در زمینهی تشخیص گوینده صورت گرفته است، اما چالشهایی وجود دارد که هنوز حل نشدهاند. در این مقاله به منظور بهبود دقت سیستمهای تشخیص گوینده از نتروسافیک و شبکههای عصبی کانولوشنال بهره گرفته شده است. در روش پیشنهادی، ابتدا اسپکتروگرام سیگنال صوتی تشکیل میگردد سپس اسپکتروگرام به فضای نتروسافیک منتقل میشود. در مرحلهی بعد عملگرهای بهبود بتا به مجموعههای نتروسافیک اعمال میشود و این عملیات تا ثابت شدن آنتروپی مجموعههای نتروسافیک تکرار میگردد. در نهایت یک مدل شبکهی عصبی کانولوشنال برای طبقهبندی هیستوگرام پیشنهاد میشود. برای ارزیابی و تحلیل روش پیشنهادی از دو پایگاه دادهی Aurora2 و TIMIT استفاده شده است. روش پیشنهادی روی پایگاه دادهی Aurora2 به دقت 79/93 درصد و روی پایگاه دادهی TIMIT به دقت 24/95 درصد دست یافته است که در مقایسه با روشهای رقیب عملکرد بهتری داشته است.