دستهبندی تصاویر در مدارک علمی بر اساس یک روش یادگیری عمیق
نویسندگان
1 استادیار، گروه سیستمهای اطلاعاتی، پژوهشکده فناوری اطلاعات، پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک)، تهران، ایران
2 استادیار، گروه سیستمهای اطلاعاتی، پژوهشکده فناوری اطلاعات، پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک)، تهران، ایران
doi
10.22034/aimj.2023.211855چکیده
بازیابی اطلاعات از تصاویر، به دو روشِ بافتمحور و محتوا محور امکانپذیر است. در روش محتوا محور، محتوای بصری تصویر، برای بازیابی اطلاعات در نظر گرفته میشود. برای استخراج اطلاعات از محتوای تصویرها و استفاده از روشهای محتوا محور، ابتدا باید آنها را دستهبندی کرد. در این پژوهش یک روش دستهبندی برای تصاویر علمی معرفی میشود. دادههای آزمایشی این پژوهش، از رسالهها و پایاننامههای موجود در گنج، یکی از منابع غنی اسناد علمی فارسی، انتخاب شده است. دادههای آموزشی شامل 5892 تصویر است که بهصورت تصادفی از رسالهها و پایاننامههای گنج، در هفت حوزه مختلف انتخاب شده است و خبرگان آنها را برچسب زدهاند. تصاویر به شش دسته شامل عکسهای طبیعی، نقشهها، نمودارهای x-y))، جدولها، نمودارهای ساختارمند یا فلوچارتها و نمودارهای آماری دستهبندی شدند. از آنجایی که داده آموزشی بهشدت نامتقارن بودند، با استفاده از روشهای افزونه، اعضای کلاسهای کمجمعیت افزایش داده شد. بهدلیل شباهت بصری بین تصاویر بعضی از دستهها، در تصاویر علمی، استخراج ویژگیهای متمایزکننده چالشی بود؛ بنابراین از روشهای یادگیری عمیق که ویژگیها را از خود تصاویر میآموزد، استفاده شد. با توجه به حجم کم داده آموزشی، شبکه عصبی با لایهها و پارامترهای کمتر استفاده شد. بررسیها نشان داد که شبکههاییکه روی یک پایگاه داده تصاویر بزرگ، از پیش آموزش داده شدهاند، دقت بهتری دارند. بر اساس نتایج این پژوهش، شبکه از پیش آموزش داده شده VGG16، با 16 لایه، با دقت 97درصد روی داده آزمون، در دستهبندی تصاویر علمی عملکرد خوبی دارد.