استفاده از تکنولوژی دادههای عظیم در نظرکاوی
نویسندگان
1 دانشکده مهندسی، دانشگاه ولیعصر (عج) رفسنجان، رفسنجان، ایران
2 دانشکده مهندسی، دانشگاه فردوسی مشهد، مشهد، ایران
3 دانشکده مهندسی، دانشگاه فردوسی مشهد، مشهد، ایران
doi
10.22052/scj.2021.111450چکیده
نظرات، نقش مهم و تعیین کنندهای در فرآیند تصمیمگیری چه برای مشتریان و چه برای سازمانهای تجاری ایفا میکنند. از این رو، وجود سیستمهای خودکار نظرکاوی برای دادههای نظری موجود در وب، ضروری به نظر میرسد. از طرفی، با حجم بالا و رشد روزافزون دادههای نظری روی وب، فرآیند نظرکاوی میتواند با چالشی بزرگ روبهرو شود؛ چرا که پردازش و تحلیل این حجم عظیم از دادهها با تکنولوژیهای متداول، ممکن است عملی نباشد. در صورتی که سیستمهای کاوش نظرات به تکنولوژیهای دادههای عظیم مجهز شوند، بدون نگرانی از مدیریت، ذخیرهسازی و مدیریت حجم روزافزون دادههای نظری، میتوانند به کار خود ادامه دهند. با آنکه در سالهای اخیر تحقیقات زیادی در حوزه تحلیل حسی نظرات انجام شده است، اما تلاشهای کمی در حوزه کاوش دادههای نظری در حیطه زبان فارسی در مقیاس بالا انجام گرفته است. از این رو، در این تحقیق، دو روش نظرکاوی برای دادههای زبان فارسی با استفاده از یک لغتنامه حسی زبان فارسی در بستر تکنولوژی دادههای عظیم ارائه شده است. برای ذخیرهسازی و پردازش دادههای نظری از چارچوب متداول و کارای هدوپ و مدل برنامهنویسی نگاشت_کاهش (MapReduce) استفاده شده است. نتایج به دست آمده از آزمایشها حاکی از آن است که چارچوب پیشنهادی برای نظرکاوی به شکلی کارا عمل کرده و نه تنها برای حجمهای بالا بلکه در حجمهای حدود 20 مگابایت شاهد افزایش 100 برابری در کارامدی هستیم. این ضریب، در حجمهای بالاتر به شکل محسوستری افزایش مییابد.