دسته‌بندی تصاویر در مدارک علمی بر اساس یک روش یادگیری عمیق

نویسندگان

1 استادیار، گروه سیستم‌های اطلاعاتی، پژوهشکده فناوری اطلاعات، پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک)، تهران، ایران

2 استادیار، گروه سیستم‌های اطلاعاتی، پژوهشکده فناوری اطلاعات، پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک)، تهران، ایران

doi
10.22034/aimj.2023.211855
چکیده

بازیابی اطلاعات از تصاویر، به دو روشِ بافت‌محور و محتوا محور امکان‌پذیر است. در روش محتوا محور، محتوای بصری تصویر، برای بازیابی اطلاعات در نظر گرفته ‌می‌شود. برای استخراج اطلاعات از محتوای تصویرها و استفاده از روش‏های محتوا محور، ابتدا باید آن‌ها را دسته‌بندی کرد. در این پژوهش یک روش دسته‌بندی برای تصاویر علمی معرفی می‌شود. داده‌های آزمایشی این پژوهش، از رساله‌ها و پایان‌نامه‌های موجود در گنج، یکی از منابع غنی اسناد علمی فارسی، انتخاب شده است. داده‌های آموزشی شامل 5892 تصویر است که به‌صورت تصادفی از رساله‌ها و پایان‌نامه‌های گنج، در هفت حوزه مختلف انتخاب شده است و خبرگان آن‌ها را برچسب زده‌اند. تصاویر به شش دسته شامل عکس‏های طبیعی، نقشه‌ها، نمودارهای x-y))، جدول‏ها، نمودارهای ساختارمند یا فلوچارت‌ها و نمودارهای آماری دسته‌بندی شدند. از آنجایی که داده آموزشی به‌شدت نامتقارن بودند، با استفاده از روش‏های افزونه، اعضای کلاس‌های کم‌جمعیت افزایش داده شد. به‌دلیل شباهت بصری بین تصاویر بعضی از دسته‌ها، در تصاویر علمی، استخراج ویژگی‌های متمایزکننده چالشی بود؛ بنابراین از روش‏های یادگیری عمیق که ویژگی‌ها را از خود تصاویر می‌آموزد، استفاده شد. با توجه به حجم کم داده آموزشی، شبکه عصبی با لایه‌ها و پارامترهای کمتر استفاده شد. بررسی‌ها نشان داد که شبکه‌هایی‌که روی یک پایگاه داده تصاویر بزرگ، از پیش آموزش داده شده‌اند، دقت بهتری دارند. بر اساس نتایج این پژوهش، شبکه از پیش آموزش داده شده  VGG16، با 16 لایه، با دقت 97درصد روی داده آزمون، در دسته‌بندی تصاویر علمی عملکرد خوبی دارد.