آموزش در دادههای نامتوازن با استفاده از روش آموزش با داده محدود مبتنی بر فیلتر DEKF برای بهبود تشخیص نفوذ حملات سایپری
نویسندگان
1 استادیار،دانشگاه صنعتی مالک اشتر ، تهران، ایران
2 دانشجوی دکتری،دانشگاه صنعتی مالک اشتر ، تهران، ایران
3 استادیار،دانشگاه صنعتی مالک اشتر ، تهران، ایران
doi
چکیده
در حالی که تکنیکهای یادگیری ماشین به منظور بهبود سیستم تشخیص نفوذ حملات سایبری به شکلی گسترده مورد استفاده قرار میگیرند، چالشهای متعدد، به ویژه در زمینه مدیریت مجموعهدادههای نامتوازن و تشخیص حملات نادر مانند R2L و U2R به دلیل ناکافی بودن تعداد نمونههای آنها در مجموعهدادههای آموزشی، به قوت خود باقی هستند. مجموعهدادههای نامتوازن، چالشی رایج و همیشگی در هنگام ارزیابی عملکرد سیستم تشخیص نفوذ بوده و اغلب منجر به انحراف به سمت کلاس اکثریت میشوند؛ این عامل به نوبه خود، مانع از شناسایی حملات کلاسهای اقلیت خواهد شد. طبقهبندی کنندههای نیز یادگیری ماشین که عمدتاً مبتنی بر دقت هستند، قادر به شناسایی حملات سایبری نادر نخواهند بود. به علاوه، همپوشانی کلاسها انتخاب ویژگی را پیچیدهتر کرده و مانع تشخیص دقیق نفوذ خواهد شود. ما در این مقاله، برای مقابله با این چالشها، راهکاری ارائه میکنیم که منشأ آن در آموزش با داده محدود، به ویژه یادگیری متا مدل آگنوستیک MAML نهفته است. الگوریتم MAML سنتی محدودیتهایی دارد که از آن جمله میتوان به همگرایی کُند و الزامات محاسباتی اشاره کرد. به منظور ارتقای عملکرد MAML، این مقاله فیلتر کالمن گسترشیافته جداشده از گره NDEKF را به عنوان جایگزینی برای گرادیان نزولی در حلقۀ داخلی معرفی میکند. الگوریتم NDEKF باعث بهینهسازی آموزش MAML، تسریع همگرایی و بهبود تعمیم خواهد شد. فیلتر فوق محاسبات را سادهتر و آن را برای شبکههای عصبی عمیق بهینهسازی میکند. برای حل معضل دادههای نامتوازن در سیستم تشخیص نفوذ از ترکیب دو الگوریتم MAML و NDEKF تحت عنوان MAML- NDEKF استفاده شده است. این رویکرد پیشنهادی، بر روی مجموعهداده NSL-KDD ارزیابی میشود. بعد از اعمال این رویکرد، همگرایی به سرعت بهبود مییابد، قابلیت تعمیم افزایش پیدا میکند و در مقایسه با الگوریتم اصلی MAML، هنگام رویارویی با مجموعهداده پراکنده و ناپایداری مانند NSL-KDD دقت بالاتری حاصل میگردد. چارچوب پیشنهادی ما به طور خاص، پیشرفتهای قابل توجهی در زمینه تشخیص دقیق حملات R2L و U2R نشان داده است. نرخ دقت تشخیص حملات R2L و U2R در این رویکرد علیرغم کاهش تعداد دورههای آموزش، بیشتر از MAML اصلی بوده و به ترتیب از 61% به 75% و از 51% به 66% افزایش یافته است.