تشخیص متن در اسناد فارسی چاپی بر اساس شبکههای عصبی بازگشتی
نویسندگان
1 دکتری تخصصی پردازش تصویر کامپیوتری استادیار، پژوهشگاه علوم و فناوری اطلاعات (ایرانداک)، تهران، ایران.
2 دکتری تخصصی مهندسی صنایع استادیار، پژوهشگاه علوم و فناوری اطلاعات (ایرانداک) )، تهران، ایران.
3 دستیار پژوهشی، پژوهشگاه علوم و فناوری اطلاعات (ایرانداک) )، تهران، ایران
4 دستیار پژوهشی، پژوهشگاه علوم و فناوری اطلاعات (ایرانداک)، تهران، ایران.
doi
10.22034/jipm.2025.2052358.1926چکیده
تشخیص خودکار متن فارسی بهدلیل ویژگیهای یکتای خط فارسی از جمله ساختار پیوسته، اشتراک بالای ویژگیهای بصری بین حروف، و تنوع بالای نوشتاری حروف با توجه به موقعیت آنان در کلمه همواره چالشبرانگیز بوده است. هدف این پژوهش ارائه یک مدل نویسهخوانی نوری است که بتواند اسناد چاپی و علمی فارسی را که شامل پایاننامهها، مقالات و کتب فارسی است، به متن قابل ویرایش تبدیل کند. این امر برای برچسبگذاری، فهرستبندی و بازیابی اطلاعات در پایگاه دادهها یک ضرورت محسوب میشود. این مقاله رویکردی ترکیبی مبتنی بر معماریهای یادگیری عمیق برای تشخیص متن فارسی ارائه میدهد. در این روش از شبکههای عصبی پیچشی برای استخراج ویژگیها و از شبکههای عصبی بازگشتی برای تشخیص کلمات استفاده میشود. مزیت اصلی این مدل، توانایی آن در تشخیص مستقیم متن چاپی فارسی بدون نیاز به پیشپردازشهای پیچیده مانند ناحیهبندی حروف است. مدل پیشنهادی با استفاده از یک مجموعه داده اختصاصی و بزرگ، شامل بیش از دو میلیون نمونه که با پنج فونت متداول فارسی تولید شده، آموزش داده شده است. مدل معرفیشده دقت 81 درصد در تشخیص حروف فارسی و 60 درصد در تشخیص کلمات دارد. عمدهترین خطاها در کلمات مرتبط با نیمفاصله و علائم بود.