آموزش در داده‌های نامتوازن با استفاده از روش آموزش با داده محدود مبتنی بر فیلتر DEKF برای بهبود تشخیص نفوذ حملات سایپری

نویسندگان

1 استادیار،دانشگاه صنعتی مالک اشتر ، تهران، ایران

2 دانشجوی دکتری،دانشگاه صنعتی مالک اشتر ، تهران، ایران

3 استادیار،دانشگاه صنعتی مالک اشتر ، تهران، ایران

doi
چکیده

در حالی که تکنیک‌های یادگیری ماشین به منظور بهبود سیستم تشخیص نفوذ حملات سایبری به شکلی گسترده مورد استفاده قرار می‌گیرند، چالش‌های متعدد، به ویژه در زمینه مدیریت مجموعه‌داده‌‌های نامتوازن و تشخیص حملات نادر مانند R2L و U2R به دلیل ناکافی بودن تعداد نمونه‌های آنها در مجموعه‌داده‌‌های آموزشی، به قوت خود باقی هستند. مجموعه‌داده‌‌های نامتوازن، چالشی رایج و همیشگی در هنگام ارزیابی عملکرد سیستم تشخیص نفوذ بوده و اغلب منجر به انحراف به سمت کلاس اکثریت می‌شوند؛ این عامل به نوبه خود، مانع از شناسایی حملات کلاس‌های اقلیت خواهد شد. طبقه‌بندی کننده‌های نیز یادگیری ماشین که عمدتاً مبتنی بر دقت هستند، قادر به شناسایی حملات سایبری نادر نخواهند بود. به علاوه، همپوشانی کلاس‌ها انتخاب ویژگی را پیچیده‌تر کرده و مانع تشخیص دقیق نفوذ خواهد ‌شود. ما در این مقاله، برای مقابله با این چالش‌ها، راهکاری ارائه می‌کنیم که منشأ آن در آموزش با داده محدود، به ویژه یادگیری متا مدل آگنوستیک MAML نهفته است. الگوریتم MAML سنتی محدودیت‌هایی دارد که از آن جمله می‌توان به همگرایی کُند و الزامات محاسباتی اشاره کرد. به منظور ارتقای عملکرد MAML، این مقاله فیلتر کالمن گسترش‌یافته جداشده از گره NDEKF را به عنوان جایگزینی برای گرادیان نزولی در حلقۀ داخلی معرفی می‌کند. الگوریتم NDEKF باعث بهینه‌سازی آموزش MAML، تسریع همگرایی و بهبود تعمیم خواهد شد. فیلتر فوق محاسبات را ساده‌تر و آن را برای شبکه‌های عصبی عمیق بهینه‌سازی می‌کند. برای حل معضل داده‌های نامتوازن در سیستم تشخیص نفوذ از ترکیب دو الگوریتم MAML و NDEKF تحت عنوان MAML- NDEKF استفاده شده است. این رویکرد پیشنهادی، بر روی مجموعه‌داده‌ NSL-KDD ارزیابی می‌شود. بعد از اعمال این رویکرد، همگرایی به سرعت بهبود می‌یابد، قابلیت تعمیم افزایش پیدا می‌کند و در مقایسه با الگوریتم اصلی MAML، هنگام رویارویی با مجموعه‌داده‌ پراکنده و ناپایداری مانند NSL-KDD دقت بالاتری حاصل می‌گردد. چارچوب پیشنهادی ما به طور خاص، پیشرفت‌های قابل توجهی در زمینه تشخیص دقیق حملات R2L و U2R نشان داده است. نرخ دقت تشخیص حملات R2L و U2R در این رویکرد علی‌رغم کاهش تعداد دوره‌های آموزش، بیشتر از MAML اصلی بوده و به ترتیب از 61% به 75% و از 51% به 66% افزایش یافته است.