دسته بندی داده های وب تاریک به کمک مدل زبانی BERT
نویسندگان
1 دانشجوی کارشناسیارشد، دانشکده مهندسی کامپیوتر،دانشگاه صنعتی شاهرود ، شاهرود، ایران
2 استادیار،دانشکده مهندسی کامپیوتر، دانشگاه صنعتی شاهرود، شاهرود، ایران
doi
10.47176/ECDJ.2025.1624چکیده
ماهیت پنهان و دسترسی محدود وبتاریک، موجب گسترش فعالیتهای مجرمانه بسیاری از جمله تهدیدات سایبری، فروش اسلحه، فروش مواد مخدر و فروش ابزارهای غیرقانونی شده است. ظهور مدلهای زبانی بزرگ این امید را ایجاد نموده است که بتوان با دقت مناسبی به تحلیل مطالب موجود در وب تاریک پرداخت. در همین راستا استفاده از دادههای انبوه سایبری موجود در وبتاریک برای جلوگیری از تهدیدات سایبری و آموزش مدلهای زبانی بسیار مفید و مؤثر خواهد بود. تکنولوژی مدلهای زبانی بزرگ برای آموزش بهتر و رسیدن به دقت کافی، به داده زیاد و باکیفیت بالا نیاز دارند و این چالشی است که محققان حوزه امنیت سایبری با توجه به آلوده بودن دادههای موجود در وبتاریک روبرو هستند. اغلب تحقیقات در این زمینه، متمرکز بر روی تمام مشخصههای دادگان وبتاریک و دادههای باکیفیت پایین صورت پذیرفته است و نتوانستهاند دقت بالایی را کسب کنند. در این پژوهش یک مدل زبانی جدید بر پایه مدل زبانی پایه BERT که بر روی داده استخراج شده از وبتاریک آموزشدیده است، ارائه کردیم. مدل پیشنهادی یک مدل متنی مبتنی بر ترانسفورماتور است که از رمزگذار دوطرفه از ترانسفورماتورها برای رویکرد یادگیری استفاده میکند و آن را بر روی یک دادگان باکیفیت بالا، بدون داده تکراری، عاری از کلمات نامعلوم، تماماً به زبان انگلیسی و به طور مشخص بر روی دادههای هک و امنیت ارزیابی نمودیم. در نهایت با تحلیل مقادیر ارزیابیشده مدل پیشنهادی با مدلهای قبلی، مشخص شد که مدل پیشنهادی به علت تزریق دادههای باکیفیت نسبت به مدلهای قبلی، توانسته دقت بهتری در دستهبندی دادهها داشته باشد.