دسته‌بندی پیکره‌بنیاد هم‌نگاره‌های فارسی

نویسندگان

1 پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک) ،تهران ، ایران

doi
10.22034/jipm.2023.698610
چکیده

ابهام، یکی از چالش‌های بزرگ در پردازش زبان طبیعی است. در پردازش رایانه‌ای متون، هم‌نگاره‌ها و چگونگی رفع ابهام از آن‌ها از اهمیت بالایی برخوردار است. در زبان‌هایـی ماننـد زبـان فارسـی که سـاخت‌واژة پیچیـده‌ای دارنـد، هم‌نگاره‌هـای بســیاری ســاخته می‌شــوند. در این راستا شناخت هم‌نگاره‌ها و دسته‌بندی انواع آن‌ها بسیار مهم است. در پژوهش حاضر به‌منظور بررسی پیکره-بنیاد هم‌نگاره‌های فارسی، واژه‌هایی که بیش از یک برچسب اجزای واژگانی کلام داشتند، از پیکرة متنی فارسی استخراج شدند که شامل 10978 واژه است. سپس، فراوانی برچسب‌های هر هم‌نگاره مورد بررسی قرار گرفت و فهرست دیگری استخراج شد که شامل هم‌نگاره‌هایی است که افزون ‌بر فراوانی بالای برچسب اول آن‌ها (بیش از 20)، فراوانی برچسب‌ دوم آن‌ها نیز در پیکرة متنی فارسی بیش از 10 بوده است. این فهرست شامل 1675 هم‌نگاره است. ماهیت ساخت‌واژی، آوایی یا معنایی هم‌نگاره‌های استخراج‌شده در این مرحله مورد بررسی قرار گرفت و بر اساس آن، هم‌نگاره‌های استخراج‌شده در یازده دسته طبقه‌بندی شد که از میان آن‌ها، تنها هم‌نگاره‌های موجود در یک دسته بر اساس معیار معنایی طبقه‌بندی شده‌اند و بقیه بر اساس ویژگی‌های ساخت‌واژی و تفاوت‌های آوایی آن‌ها در دسته‌های گوناگون قرار گرفته‌اند. نتایج این پژوهش شامل فهرست گسترده‌ای از هم‌نگاره‌های فارسی استخراج‌شده از پیکرة متنی فارسی است که هر کدام بر اساس معیارهای ساخت‌واژی و آوایی در یک یا بیش از یک دسته از مجموع یازده دسته قرار گرفته‌اند. این فهرست و دسته‌بندی مربوط به هم‌نگاره‌ها می‌تواند در سیستم‌های رفع ابهام معنایی از واژگان مورد استفاده قرار گیرد