بهینهسازی سازماندهی اسناد متنی فارسی با استفاده از تکنیک خوشهبندی
نویسندگان
1 گروه علم اطلاعات و دانش شناسی، دانشگاه قم، قم ، ایران
2 گروه علم اطلاعات و دانش شناسی، دانشگاه قم، قم ، ایران
3 پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک) ،تهران ، ایران
doi
10.22034/jipm.2023.698613چکیده
پژوهش حاضر با هدف ارائة روشی برای سازماندهی اسناد متنی فارسی با استفاده از تکنیک خوشهبندی انجام شد. مجموعه دادههای مربوط به پایاننامهها و رسالهها شامل 2943 تحقیق بهعنوان جامعة آماری در نظر گرفته شد. جمعآوری دادهها از مجموعه دادههای مربوط به تحقیقات علمی که شامل 5000 پژوهش در قالب فایل اکسل بود، انجام شد. در این پژوهش پس از تبدیل دادههـا به قالب ساختیافتـه، عملیات پردازش با استفاده از اعمال پیشپردازش صورت گرفت. در مرحلة پردازش از تکنیک خوشهبندی برای ارائة الگوریتم پیشنهادی در راستای سازماندهی اسناد متنی فارسی بهره گرفته شد. این الگوریتم با بهبود الگوریتم K-means در جهت خوشهبندی اسناد ارائه شد. نتایج حاصل از ارزیابی نشان داد که الگوریتم پیشنهادی بر اساس معیارهای خارجی نسبت به دو الگوریتم K-means و K-means++ در کیفیت خوشهبندی اسناد تأثیر مثبتی داشت؛ بهطوری که تحقیقات هر ردة تعیین شده در خوشة موضوعی مرتبط دارای توزیع یکنواختی شد، و به حصول هدف پژوهش حاضر منجر گردید. در جداول رده/ خوشة حاصل از دو الگوریتم K-means و K-means++ توزیع غیریکنواخت تحقیقات در خوشهها مشاهده شد. بنابراین، ارزیابی بر اساس معیارهای داخلی متأثر از تراکم متفاوت خوشهها و شباهت بین خوشهای بود. حجم دیتاسِت نیز متأثر از راهکارهای پیشنهادی برای انتخاب دیتاسِت نهایی و فرایند پژوهش نبود. بنابراین، الگوریتم پیشنهادی برای ابعاد بالای ویژگی نیز مناسب عمل میکند.