دستهبندی پیکرهبنیاد همنگارههای فارسی
نویسندگان
1 پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک) ،تهران ، ایران
doi
10.22034/jipm.2023.698610چکیده
ابهام، یکی از چالشهای بزرگ در پردازش زبان طبیعی است. در پردازش رایانهای متون، همنگارهها و چگونگی رفع ابهام از آنها از اهمیت بالایی برخوردار است. در زبانهایـی ماننـد زبـان فارسـی که سـاختواژة پیچیـدهای دارنـد، همنگارههـای بســیاری ســاخته میشــوند. در این راستا شناخت همنگارهها و دستهبندی انواع آنها بسیار مهم است. در پژوهش حاضر بهمنظور بررسی پیکره-بنیاد همنگارههای فارسی، واژههایی که بیش از یک برچسب اجزای واژگانی کلام داشتند، از پیکرة متنی فارسی استخراج شدند که شامل 10978 واژه است. سپس، فراوانی برچسبهای هر همنگاره مورد بررسی قرار گرفت و فهرست دیگری استخراج شد که شامل همنگارههایی است که افزون بر فراوانی بالای برچسب اول آنها (بیش از 20)، فراوانی برچسب دوم آنها نیز در پیکرة متنی فارسی بیش از 10 بوده است. این فهرست شامل 1675 همنگاره است. ماهیت ساختواژی، آوایی یا معنایی همنگارههای استخراجشده در این مرحله مورد بررسی قرار گرفت و بر اساس آن، همنگارههای استخراجشده در یازده دسته طبقهبندی شد که از میان آنها، تنها همنگارههای موجود در یک دسته بر اساس معیار معنایی طبقهبندی شدهاند و بقیه بر اساس ویژگیهای ساختواژی و تفاوتهای آوایی آنها در دستههای گوناگون قرار گرفتهاند. نتایج این پژوهش شامل فهرست گستردهای از همنگارههای فارسی استخراجشده از پیکرة متنی فارسی است که هر کدام بر اساس معیارهای ساختواژی و آوایی در یک یا بیش از یک دسته از مجموع یازده دسته قرار گرفتهاند. این فهرست و دستهبندی مربوط به همنگارهها میتواند در سیستمهای رفع ابهام معنایی از واژگان مورد استفاده قرار گیرد