پیکره چکیدههای مقالات و پایاننامههای دانشگاهی دانشگاه علامه طباطبائی
نویسندگان
1 دانشگاه علامه طباطبائی
2 کارشناسی ارشد هوش مصنوعی دانشگاه الزهرا
doi
10.30465/lsi.2023.43633.1644چکیده
این مقاله از نحوۀ شکلگیری پیکرۀ «چکیدههای مقالات و پایاننامههای دانشگاهی دانشگاه علامه طباطبائی» و همچنین از ویژگیها و امکانات آن میگوید. دادههای این پیکره شامل ده هزار چکیده پایاننامه و 9538 چکیده مقاله (برگرفته از نشریات علمی دانشگاه علامه طباطبائی) با حجمی در حدود سه و نیم میلیون موردواژه است که در قالب طرح پژوهشی گردآوری شدهاند. اهمیت دادههای این پیکره یعنی چکیدههای دانشگاهی از آن جهت است که این نوع دادهها به عنوان متون تألیفیِ فشرده و با محتوای علمی میتوانند تصویرگر ویژگیهای خاص زبان علم به عنوان گونهای از زبان باشند. در این نوشتار برای بیان اهمیت دسترسی به چنین دادههایی و به جهت بررسی امکانات پیکره، محتوایِ واژهایِ بخشی از داده با توجه به مفهوم کلیدیبودگی و فهرست چندپشتهها مورد بررسی قرار گرفت. بررسیها نشان داد محتوای واژگانی این پیکره میتواند پژوهشگران را به سوی طرح برخی فرضیهها سوق دهد. همچنین بررسی چندپشتههای دادههای علمی نشان داد که زبان علم دارای توالیهای واژهای مشخصی است که میتواند تصویرگر نوع خاصی از زبان باشد.