شناسایی فایل‌های آلوده غیراجرایی به‌کمک مدل‌های یادگیری ماشین

نویسندگان
doi
10.22034/csj.2025.233053
چکیده

با افزایش استفاده کاربران از اسناد آفیس و پی‌دی‌اف و استفاده این نوع فایل‌ها در مراکز امنیتی جهت انتقال اطلاعات، توجه طراحان بدافزار به این فایل‌ها جلب شده است . فعالیت‌‌های گوناگونی جهت تشخیص این نوع فایل‌‌ها با انتخاب ویژگی‌های تعیین‌کننده هر نوع فایل صورت گرفته است. در این پژوهش سعی شده است تا با تهیه مجموعه داده تقویت ‌شده و همچنین ارائه ویژگی‌‌های مؤثر و جامع برای انواع فایل‌های ذکر شده، به‌طوری که حملات مربوط به هر نوع فایل ‌را پوشش ‌دهند، نرخ تشخیص بدافزارهای مربوطه افزایش داده شود. در این راستا، این مطالعه توانست با به کارگیری مدل‌های طبقه‌‌بند دودویی، در مقایسه با برترین مطالعات انجام شده، به بهبود 2 درصدی تشخیص بدافزارهای پی‌دی‌اف با مدل گرادیان افزایشی و همچنین بهبود 9/1 درصدی تشخیص بدافزارهای آفیس با مدل جنگل تصادفی دست پیدا کند. به‌‌طور دقیق‌‌تر، این مطالعه با اعمال مدل گرادیان افزایشی بر روی فایل‌‌های پی‌دی‌اف، توانست به دقت 3/99 درصدی تشخیص فایل‌های آلوده دست پیدا کند در حالی که برای فایل‌‌های آفیس با اعمال مدل جنگل تصادفی، به نرخ 4/99 درصدی در تشخیص بدافزارها رسیده شد.