مروری بر روش‌های انتخاب ویژگی نیمه‌نظارتی تُنک مبتنی بر گراف

نویسندگان

1 گروه مهندسی کامپیوتر، دانشکده فنی و مهندسی، دانشگاه اردکان، اردکان، ایران

doi
10.22034/abmir.2022.2899
چکیده

در برخی از کاربردهای دنیای واقعی، داده‌هایی با ابعاد بالا وجود دارند که چالش‌های محاسباتی زیادی را ایجاد کرده‌اند. یکی از تکنیک‌های موثر برای کاهش ابعاد داده‌ها، انتخاب ویژگی است که با انتخاب زیرمجموعه مناسبی از ویژگی‌ها باعث سادگی مدل و بهبود کارایی آن می‌شود. در بسیاری از این کاربردها، برچسب زدن داده‌ها امری زمان‌بر و پرهزینه است که باعث می‌شود داده‌های برچسب‌دار کمی وجود داشته باشند و حجم عظیمی از داده‌های بدون برچسب در دسترس باشند. در چنین کاربردهایی، روش‌های انتخاب ویژگی نیمه‌نظارتی می‌توانند با استفاده از اطلاعات برچسب داده‌های برچسب‌دار و اطلاعات توزیع و ساختار هندسی داده‌های برچسب‌دار و بدون برچسب، فرایند انتخاب ویژگی را انجام دهند. در اکثر روش‌های انتخاب ویژگی نیمه‌نظارتی، با ایجاد یک گراف همسایگی، ویژگی‌های مناسب از طریق بررسی توانایی‌ آن‌ها در حفظ ساختار هندسی گراف ارزیابی می‌شوند. در روش‌های کلاسیک انتخاب ویژگی نیمه‌نظارتی مبتنی بر گراف، ویژگی‌ها به صورت جداگانه ارزیابی می‌شوند و همبستگی بین ویژگی‌ها در هنگام انتخاب ویژگی در نظر گرفته نمی‌شود. روش‌های انتخاب ویژگی تُنک با در نظر گرفتن همبستگی بین ویژگی‌ها، ماتریس انتقال بهینه تُنک برای انتخاب ویژگی‌ را محاسبه می‌نمایند. در این مقاله با بررسی روش‌های یادگیری نیمه‌نظارتی، مروری بر روش‌های انتخاب ویژگی نیمه‌نظارتی تُنک مبتنی بر گراف انجام می‌شود که با استفاده از عبارت تنظیم مبتنی بر مدل‌های تُنک و با ایجاد گراف همسایگی، ویژگی‌های مناسب را انتخاب می‌کنند. این روش‌ها ضمن برطرف کردن مشکل روش‌های انتخاب ویژگی کلاسیک، با ایجاد یک گراف همسایگی از داده‌ها ماتریس انتقال بهینه تُنک برای انتخاب ویژگی را محاسبه می‌نمایند.