تحلیل پیکره بنیان متون فارسی میانه بر مبنای پایگاه داده پارسیگ

نویسندگان

1 دانشیار زبان‌های باستانی، پژوهشگاه علوم انسانی و مطالعات فرهنگی(نویسنده مسئول)

2 استادیار زبانشناسی،پژوهشگاه علوم انسانی و مطالعات فرهنگی

3 کارشناس پژوهشی گروه فرهنگ و زبان‌های باستانی، پژوهشکده زبان‌شناسی، پژوهشگاه علوم انسانی و مطالعات فرهنگی

doi
10.30465/ls.2021.6590
چکیده

رویکرد نوین در مطالعات زبان‎شناختی یا یک پدیده زبانی بر اصل وجود مجموعه‌ای از داده‌های زبانی گردآوری‌شده نهادینه شده‎است؛ بنابراین به تهیه یک پیکره زبانی نیاز  است که از تولیدات واقعی گویشوران و نه براساس شمّ زبانیِ فردی گردآوری شده‎است. این شیوۀ پژوهشی برای بررسی داده‎های زبانی تاریخی که جزء زبان‌های مرده است و اکنون هیچگونه گویشوری ندارد از اهمیت به‎سزایی برخوردار است. هدف از انجام این پژوهش،‌ تهیه پیکرۀ زبان پهلوی ساسانی (فارسی میانه) و ساماندهی آن در یک پایگاه است. برای هر واژه، شش لایۀ اطلاعاتی، اعم از حرف‏نویسی متن پهلوی، آوانویسی واژه‌ها به‌همراه ترجمۀ فارسی آنها، تعیین مقولۀ دستوری دانه‎ریز واژه‌ها، بن‌واژه‌سازی واژه‌ها و تعیین هزوارش‌بودن آنها، تعریف شده‎است. برای مقولۀ دستوری دانه‎ریز واژه‎ها، مجموعۀ برچسب مقولات دستوری فارسی معاصر تهیه‎شده توسط بی‎جن‎خان و همکاران (2011) و ساختارمندشده توسط قیومی (2014) باتوجه‏به نیازهای زبان پهلوی جرح و تعدیل شده‌است و از مجموعۀ جدید برای برچسب‎گذاری واژه‎های پهلوی استفاده شده‌است. پس ‎از نشانه‌گذاری واژه‎ها و ساماندهی اطلاعات، امکان استخراج اطلاعات آماری وجود دارد که می‎تواند بینش عمیق‎تری از محتوای متن منتقل نماید. ازاین‌رو، اطلاعات آماری از پیکرۀ به‌دست‌آمده استخراج شده و توضیح داده می‌شود تا دورنمای کلی نسبت‌به منابع تشکیل‌دهندۀ این پیکره به‌دست‌آید.