انتخاب ویژگی نیمهنظارتی مبتنیبر خودرمزنگار گراف با حفظ ساختار محلی-گسترده
نویسندگان
1 دانشیار، گروه مهندسی کامپیوتر، دانشکده فنی و مهندسی، دانشگاه اردکان، اردکان، ایران
2 دانشجوی دکتری، دانشکده مهندسی کامپیوتر، دانشگاه یزد، یزد، ایران
3 دانشیار، دانشکده مهندسی کامپیوتر، دانشگاه یزد، یزد، ایران
doi
10.22034/abmir.2025.23363.1140چکیده
پردازش دادههای با ابعاد بالا چالش مهمی در حوزههای مختلف است و انتخاب ویژگی بهعنوان روشی مؤثر برای کاهش ابعاد، نقش کلیدی در بهبود عملکرد مدلهای یادگیری ماشین دارد. از آنجا که برچسبگذاری دادهها پرهزینه و زمانبر است، انتخاب ویژگی نیمهنظارتی که از دادههای بدون برچسب نیز استفاده کند، اهمیت ویژهای دارد. در این مقاله، یک روش انتخاب ویژگی نیمهنظارتی تنک مبتنی بر خودرمزنگار گراف ارائه میشود که دو نوآوری اصلی دارد: (1) ترکیب خودرمزنگار برای حفظ ساختار کلی داده و گراف طیفی نیمهنظارتی برای حفظ ساختار محلی و اطلاعات برچسب (2) اعمال منظمسازی نرم-L_(2,1) برروی ماتریس وزن رمزگذار تا سطرهای غیرمؤثر به صفر میل کرده و ویژگیهای نامرتبط بهطور خودکار حذف شوند. بهینهسازی مسئله با الگوریتم گرادیان و پسانتشار انجام شده و مشتق منظمسازی در بهروزرسانی پارامترها لحاظ میشود؛ بدین ترتیب انتخاب ویژگی به صورت درونمدلی و همزمان با آموزش شبکه انجام میگیرد. روش پیشنهادی بر روی شش مجموعهداده استاندارد UCI شامل ORL، ATT، WBCD، WDBC، QSAR و پارکینسون ارزیابی و با پنج روش مرجع مقایسه شد. معیار ارزیابی، دقت طبقهبندی با استفاده از ماشین بردار پشتیبان و k-نزدیکترین همسایه بود. نتایج دو طبقهبند برروی شش مجموعه داده به ترتیب 78/0، 88/0، 98/0، 97/0، 81/0، 91/0 و 75/0، 92/0، 97/0، 94/0، 82/0، 92/0 نشان داد که روش پیشنهادی در اغلب موارد عملکرد برتری دارد. این یافتهها تأیید میکنند که چارچوب پیشنهادی با بهرهگیری همزمان از ساختار داده و منظمسازی تنک، قادر به انتخاب مجموعهای کارآمد از ویژگیها در شرایط نیمهنظارتی است.