تشخیص ارقام گفتاری فارسی با استفاده از شبکه های یادگیری عمیق

نویسندگان

1 دانشکده مهندسی برق و کامپیوتر دانشگاه سمنان

2 دانشگاه سمنان، دانشکده برق و کامپبوتر

3 دانشکده برق و کامپیوتر دانشگاه سمنان

doi
10.22075/jme.2023.30973.2472
چکیده

طبقه‌بندی ارقام جدا شده چالش اساسی برای بسیاری از سیستم‌های طبقه‌بندی گفتار است. درحالی‌که کارهای زیادی بر روی زبان‌های گفتاری انجام شده است، تحقیقات محدودی در مورد داده‌های رقمی گفتاری فارسی در ادبیات گزارش شده است و تمامی تحقیقات مربوط به اعداد صفر تا 9 بوده است. برای این منظور، پایگاه داده ی جامعی شامل بازه ی وسیعتری از اعداد با مشارکت 145 نفر که شامل هفتاد نفر مرد و 75 نفر زن هستند، جمع‌آوری گردیده است. پایگاه داده مذکور، بازه عددی صفر تا 599 را پوشش می‌دهد. پس از پیش‌پردازش داده ها، داده‌های صوتی تبدیل به طیف‌نگار مل شده و برای استخراج ویژگی و طبقه‌بندی داده‌ها از شبکه عصبی کانولوشنی و نیز یک مدل ترکیبی شامل مدل ترنسفورمر و حافظه کوتاه و بلند مدت استفاده گردیده است. نتایج تجربی بر روی پایگاه داده جمع آوری شده حاکی از دقت اعتبارسنجی 98.03 درصد می باشد. آنالیزهای مختلفی نیز بر روی آزمایش و آزمون مدل ها صورت گرفته است.