استخراج موضوع از متون فارسی با استفاده از چهارچوب BERTopic، مدل‌های تعبیه زبانی و خوشه بندی متن

نویسندگان

1 دانشکده مهندسی برق و کامپیوتر، دانشگاه سمنان، سمنان، ایران

2 دانشکده مهندسی برق و کامپیوتر، دانشگاه سمنان، سمنان، ایران

doi
10.22075/jme.2025.36454.2781
چکیده

با رشد اطلاعات، استخراج دانش از مجموعه‌های متنی اهمیت یافته است. استخراج موضوع، تکنیکی بدون نظارت در یادگیری ماشین است که مضامین پنهان اسناد را کشف می‌کند. در این مقاله، با الهام از BERTopic، روشی بدون نظارت برای استخراج موضوع از متون فارسی ارائه شده است. روش پیشنهادی از مدل تعبیه‌زبانی LaBSE برای تبدیل متون به بردار‌های تعبیه استفاده می‌کند. سپس، با استفاده ازUMAP، ابعاد بردارهای تعبیه را کاهش می‌دهد و پس از آن، با استفاده از الگوریتم خوشه‌بندی K-Means، متون مشابه را در خوشه‌های یکسان قرار می‌دهد. سپس با تشکیل ماتریس خوشه-توکن و تکنیک بازنمایی موضوعات، موضوعات مختلف را به ازای هر خوشه از متن استخراج می‌کند. ما LaBSE را با مدل‌های تعبیه‌زبانی XLM-R ،ParsBERT،Paraphrase-multilingual-MiniLM-L12-v2 ،Shiraz و HooshvareLab (RoBERTa) مقایسه کردیم. همچنین مقایسه‌ای بین الگوریتم‌های K-Means و HDBSCAN انجام دادیم. برای ارزیابی روش پیشنهادی، از مجموعه داده عصر ایران استفاده شد. معیار انسجام (NPMI) و معیار ارزیابی انسانی عملکرد روش‌ پیشنهادی را تأیید کردند. در الگوریتمHDBSCAN ، مدلHooshvare (RoBERTa) بر اساس معیار انسجام، و مدل‌ ParsBERT بر اساس ارزیابی انسانی بهترین نتایج را ارائه داد. در K-Means، مدل Paraphrase-multilingual- MiniLM-L12-v2 مطابق معیار انسجام و LaBSE مطابق ارزیابی انسانی، نتایج بهتری داشت. برتری K-Means نسبت به HDBSCAN نیز تأیید شد. همچنین با استفاده از دو مجموعه داده عصر ایران و تسنیم به صورت جداگانه، روش پیشنهادی با مدل‌های فاکتورسازی ماتریس غیرمنفی، تخصیص دیریکله پنهان و تحلیل معنایی پنهان مقایسه شد. نتایج مقایسه، عملکرد برجسته روش پیشنهادی را نشان می‌دهد.