بهینه‌سازی سازماندهی اسناد متنی فارسی با استفاده از تکنیک خوشه‌بندی

نویسندگان

1 گروه علم اطلاعات و دانش شناسی، دانشگاه قم، قم ، ایران

2 گروه علم اطلاعات و دانش شناسی، دانشگاه قم، قم ، ایران

3 پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک) ،تهران ، ایران

doi
10.22034/jipm.2023.698613
چکیده

پژوهش حاضر با هدف ارائة روشی برای سازماندهی اسناد متنی فارسی با استفاده از تکنیک خوشه‌بندی انجام شد. مجموعه داده‌های مربوط به پایان‌نامه‌ها و رساله‌ها شامل 2943 تحقیق به‌عنوان جامعة آماری در نظر گرفته شد. جمع‌آوری داده‌ها از مجموعه داده‌های‌ مربوط به تحقیقات علمی که شامل 5000 ‌پژوهش در قالب فایل اکسل بود، انجام شد. در این پژوهش پس از تبدیل داده‌هـا به قالب ساخت‌یافتـه، عملیات پردازش با استفاده از اعمال پیش‌پردازش صورت گرفت. در مرحلة پردازش از تکنیک خوشه‌بندی برای ارائة الگوریتم پیشنهادی در راستای سازماندهی اسناد متنی فارسی بهره گرفته شد. این الگوریتم با بهبود الگوریتم K-means در جهت خوشه‌بندی اسناد ارائه شد. نتایج حاصل از ارزیابی نشان داد که الگوریتم پیشنهادی بر اساس معیارهای خارجی نسبت به دو الگوریتم K-means و K-means++ در کیفیت خوشه‌بندی اسناد تأثیر مثبتی داشت؛ به‌طوری که تحقیقات هر ردة تعیین شده در خوشة موضوعی مرتبط دارای توزیع یکنواختی شد، و به حصول هدف پژوهش حاضر منجر گردید. در جداول رده/ خوشة حاصل از دو الگوریتم K-means‌ و K-means++ توزیع غیریکنواخت تحقیقات در خوشه‌ها مشاهده شد. بنابراین، ارزیابی بر اساس معیار‌های داخلی متأثر از تراکم متفاوت خوشه‌ها و شباهت بین خوشه‌ای بود. حجم دیتاسِت نیز متأثر از راهکارهای‌ پیشنهادی برای انتخاب دیتاسِت نهایی و فرایند پژوهش نبود. بنابراین، الگوریتم پیشنهادی برای ابعاد بالای ویژگی نیز مناسب عمل می‌کند.