انتخاب ویژگی نیمه‌نظارتی مبتنی‌بر خودرمزنگار گراف با حفظ ساختار محلی-گسترده

نویسندگان

1 دانشیار، گروه مهندسی کامپیوتر، دانشکده فنی و مهندسی، دانشگاه اردکان، اردکان، ایران

2 دانشجوی دکتری، دانشکده مهندسی کامپیوتر، دانشگاه یزد، یزد، ایران

3 دانشیار، دانشکده مهندسی کامپیوتر، دانشگاه یزد، یزد، ایران

doi
10.22034/abmir.2025.23363.1140
چکیده

پردازش داده‌های با ابعاد بالا چالش مهمی در حوزه‌های مختلف است و انتخاب ویژگی به‌عنوان روشی مؤثر برای کاهش ابعاد، نقش کلیدی در بهبود عملکرد مدل‌های یادگیری ماشین دارد. از آنجا که برچسب‌گذاری داده‌ها پرهزینه و زمان‌بر است، انتخاب ویژگی نیمه‌نظارتی که از داده‌های بدون برچسب نیز استفاده کند، اهمیت ویژه‌ای دارد. در این مقاله، یک روش انتخاب ویژگی نیمه‌نظارتی تنک مبتنی بر خودرمزنگار گراف ارائه می‌شود که دو نوآوری اصلی دارد: (1) ترکیب خودرمزنگار برای حفظ ساختار کلی داده و گراف طیفی نیمه‌نظارتی برای حفظ ساختار محلی و اطلاعات برچسب (2) اعمال منظم‌سازی نرم-L_(2,1)  برروی ماتریس وزن رمزگذار تا سطرهای غیرمؤثر به صفر میل کرده و ویژگی‌های نامرتبط به‌طور خودکار حذف شوند. بهینه‌سازی مسئله با الگوریتم گرادیان و پس‌انتشار انجام شده و مشتق منظم‌سازی در به‌روزرسانی پارامترها لحاظ می‌شود؛ بدین ترتیب انتخاب ویژگی به صورت درون‌مدلی و هم‌زمان با آموزش شبکه انجام می‌گیرد. روش پیشنهادی بر روی شش مجموعه‌داده استاندارد UCI شامل ORL، ATT، WBCD، WDBC، QSAR  و پارکینسون ارزیابی و با پنج روش مرجع مقایسه شد. معیار ارزیابی، دقت طبقه‌بندی با استفاده از ماشین بردار پشتیبان و k-نزدیک‌ترین همسایه بود. نتایج دو طبقه‌بند برروی شش مجموعه داده به ترتیب 78/0، 88/0، 98/0، 97/0، 81/0، 91/0 و 75/0، 92/0، 97/0، 94/0، 82/0، 92/0 نشان داد که روش پیشنهادی در اغلب موارد عملکرد برتری دارد. این یافته‌ها تأیید می‌کنند که چارچوب پیشنهادی با بهره‌گیری همزمان از ساختار داده و منظم‌سازی تنک، قادر به انتخاب مجموعه‌ای کارآمد از ویژگی‌ها در شرایط نیمه‌نظارتی است.