استخراج موضوع از متون فارسی با استفاده از چهارچوب BERTopic، مدلهای تعبیه زبانی و خوشه بندی متن
نویسندگان
1 دانشکده مهندسی برق و کامپیوتر، دانشگاه سمنان، سمنان، ایران
2 دانشکده مهندسی برق و کامپیوتر، دانشگاه سمنان، سمنان، ایران
doi
10.22075/jme.2025.36454.2781چکیده
با رشد اطلاعات، استخراج دانش از مجموعههای متنی اهمیت یافته است. استخراج موضوع، تکنیکی بدون نظارت در یادگیری ماشین است که مضامین پنهان اسناد را کشف میکند. در این مقاله، با الهام از BERTopic، روشی بدون نظارت برای استخراج موضوع از متون فارسی ارائه شده است. روش پیشنهادی از مدل تعبیهزبانی LaBSE برای تبدیل متون به بردارهای تعبیه استفاده میکند. سپس، با استفاده ازUMAP، ابعاد بردارهای تعبیه را کاهش میدهد و پس از آن، با استفاده از الگوریتم خوشهبندی K-Means، متون مشابه را در خوشههای یکسان قرار میدهد. سپس با تشکیل ماتریس خوشه-توکن و تکنیک بازنمایی موضوعات، موضوعات مختلف را به ازای هر خوشه از متن استخراج میکند. ما LaBSE را با مدلهای تعبیهزبانی XLM-R ،ParsBERT،Paraphrase-multilingual-MiniLM-L12-v2 ،Shiraz و HooshvareLab (RoBERTa) مقایسه کردیم. همچنین مقایسهای بین الگوریتمهای K-Means و HDBSCAN انجام دادیم. برای ارزیابی روش پیشنهادی، از مجموعه داده عصر ایران استفاده شد. معیار انسجام (NPMI) و معیار ارزیابی انسانی عملکرد روش پیشنهادی را تأیید کردند. در الگوریتمHDBSCAN ، مدلHooshvare (RoBERTa) بر اساس معیار انسجام، و مدل ParsBERT بر اساس ارزیابی انسانی بهترین نتایج را ارائه داد. در K-Means، مدل Paraphrase-multilingual- MiniLM-L12-v2 مطابق معیار انسجام و LaBSE مطابق ارزیابی انسانی، نتایج بهتری داشت. برتری K-Means نسبت به HDBSCAN نیز تأیید شد. همچنین با استفاده از دو مجموعه داده عصر ایران و تسنیم به صورت جداگانه، روش پیشنهادی با مدلهای فاکتورسازی ماتریس غیرمنفی، تخصیص دیریکله پنهان و تحلیل معنایی پنهان مقایسه شد. نتایج مقایسه، عملکرد برجسته روش پیشنهادی را نشان میدهد.