انتخاب ویژگی نیمه‌نظارتی تُنک مبتنی بر منظم‌سازی هسین و آنالیز تشخیصی فیشر

نویسندگان

1 استادیار- گروه مهندسی کامپیوتر- دانشکده فنی و مهندسی- دانشگاه اردکان- اردکان- ایران

doi
10.22034/tjee.2022.15428
چکیده

انتخاب ویژگی یکی از تکنیک‌های مهم در یادگیری ماشین و شناسایی الگو است که با حذف ویژگی‌های نامناسب  و انتخاب زیرمجموعه­ای مفید از ویژگی‌ها باعث اجتناب از بیش‌برازش در هنگام ساخت مدل، بهبود کارایی و سادگی مدل می‌شود. در بسیاری از کاربردها، تعیین برچسب داده‌ها هزینه‌بر بوده و مستلزم صرف زمان زیادی است، درحالی‌که داده‌های بدون برچسب به آسانی در دسترس هستند. بنابراین، استفاده از روش‌های انتخاب ویژگی نیمه‌نظارتی که بتوانند در فرآیند انتخاب ویژگی از داده‌های برچسب‌دار و بدون برچسب استفاده نمایند، بسیار ارزشمند است. در این مقاله، یک روش انتخاب ویژگی تُنک نیمه‌نظارتی مبتنی بر منظم‌سازی هسین و آنالیز تشخیصی فیشر پیشنهاد می‌شود که می‌تواند با استفاده از داده‌های برچسب‌دار و اطلاعات توزیع و ساختار محلی داده‌های برچسب‌دار و بدون برچسب مناسب‌ترین ویژگی‌ها را انتخاب نماید. در روش پیشنهادی، تابع هدفی مبتنی بر ماتریس پراکندگی نیمه‌نظارتی و نُرم- l2,1 برای انتخاب ویژگی ارائه می‌شود که از منظم‌سازی هسین و آنالیز تشخیصی فیشر در ساخت ماتریس پراکندگی نیمه‌نظارتی استفاده می‌کند و همبستگی بین ویژگی‌ها را در هنگام انتخاب ویژگی در نظر می‌گیرد. برای حل تابع هدف پیشنهادی مبتنی بر منظم‌سازی هسین و آنالیز تشخیصی فیشر، الگوریتمی موثر با رویکرد تکراری به کار می‌رود و همگرایی آن به صورت تئوری و عملی اثبات می‌شود. نتایج به‌دست آمده از آزمایش‌ها بر روی پنج مجموعه داده حاکی از برتری روش‌ پیشنهادی در مقایسه با دیگر روش‌های انتخاب ویژگی استفاده شده در این مقاله است.