طبقهبندی متون فارسی مبتنی بر شبکههای عصبی عمیق
نویسندگان
1 دانشکده مهندسی برق و کامپیوتر، دانشگاه تبریز، تبریز، ایران
2 دانشکده مهندسی برق و کامپیوتر، دانشگاه تبریز، تبریز، ایران
3 دانشکده مهندسی برق و کامپیوتر، دانشگاه تبریز، تبریز، ایران
doi
10.22052/scj.2023.243182.1010چکیده
امروزه با توجه به رشد روزافزون حجم اسناد الکترونیکی، طبقهبندی متون بر اساس روشهای مختلفی در میان محققین بازیابی اطلاعات و متون عمومیت یافته است. با توجه به اهمیت موضوع و کارهایی که در این زمینه در زبانهای مختلف دنیا انجام گرفته است، نیاز به طبقهبندی متون فارسی به خوبی احساس میشود. به طور کلی روشهای طبقهبندی متون را میتوان به روشهای سنتی (مبتنی بر انتخاب ویژگی و یادگیری ماشین) و روشهای مبتنی بر یادگیری عمیق تقسیمبندی کرد. روشهای مبتنی بر یادگیری عمیق به دلیل توانایی اشتراک وزن به طور قابل توجهی سبب کاهش تعداد متغیرهای آزاد آموزشپذیر شبکه و در نتیجه افزایش تعمیمپذیری شده است و نتایج بهتری به نسبت سایر روشها میدهد. در زبان فارسی روشهای مبتنی بر یادگیری عمیق بسیار اندکی برای طبقهبندی متون ارائهشده است. در این مقاله دو مدل شبکه عصبی عمیق شامل شبکه عصبی پیچشی ParsCNN و شبکه عصبی با حافظه بلند کوتاه- مدت دوسویه سلسهمراتبی با لایه توجه ParsBiLSTM برای طبقهبندی متون فارسی تشریح شده است. کارایی سیستمهای مبتنی بر شبکه عصبی عمیق بر روی مجموعه داده همشهری بررسی شده و از نظر سه معیار ارزیابی دقت، فراخوانی و مقیاس-F مورد مطالعه قرار گرفته است. نتایج آزمایشها نشان میدهد که روش ParsCNN میزان دقت 0.69، فراخوانی 0.7 و مقیاس-F 0.69؛ همچنین روش ParsBiLSTM میزان دقت 0.72، فراخوانی 0.73 و مقیاس-F 0.72 دارند که نشاندهنده کارایی بالاتر این روشها نسبت به روشهای طبقهبندی متون فارسی مورد مطالعه است.