مقایسۀ عملکرد الگوریتم‌های پایۀ یادگیری ماشین در دسته‌بندی اشعار فارسی به دو گروه تلمیح‌دار و بدون‌تلمیح

نویسندگان

1 دانش‌آموختۀ کارشناسی ارشد زبان‌شناسی رایانشی، دانشگاه صنعتی شریف، تهران، ایران

2 استادیار، گروه رایانه، دانشگاه علامه طباطبائی، تهران، ایران

doi
10.22054/ls.2021.60784.1453
چکیده

هدف از پژوهش حاضر بررسی عملکرد چند روش‌ یادگیری ماشین در دسته‌بندی اشعار فارسی به دو گروه تلمیح‌دار و بدون‌تلمیح است. به‌این‌منظور، از روش‌های نظارت‌شدۀ بیز ساده، ماشین بردار پشتیبان، درخت تصمیم، جنگل تصادفی، k نزدیک‌ترین همسایه، رگرسیون لجستیک و الگوریتم پرسپترون چندلایه استفاده شد. پس از جمع‌آوری داده‌های برچسب‌خورده در قالب دو فایل متنی، هرکدام از ابیات به بردار عددی تبدیل شدند. پس از ادغام داده‌ها و تقسیم آنها به دو دستۀ آموزش و آزمون، الگوریتم مدنظر بر روی داده‌های آموزشی پیاد‌ه‌سازی و بر روی داده‌های آزمون، آزمایش گردید تا دقت عملکرد الگوریتم سنجیده شود. خروجی هر الگوریتم، برچسب پیش‌بینی‌شده توسط ماشین برای ابیات موردنظر بود و برای ارزیابی الگوریتم‌‌ها از روش LOOCV استفاده شد. نتایج ارزیابی نشان داد که الگوریتم‌های بیز ساده 09/76%، رگرسیون لجستیک 09/76%، پرسپترون چند لایه 22/75% و ماشین بردار پشتیبان 35/74% نسبت به الگوریتم‌های دیگر عملکرد بهتری دارند. درمجموع و با توجه به سایر معیارها، از جمله معیار اف ـ 1 و زمان اجرا، می‌توان گفت که بهترین عملکرد مربوط به الگوریتم بیز ساده بود.