متن کاوی :مفاهیم و روش ها
نویسندگان
1 دانشجوی کارشناسی ارشد مدیریت اطلاعات، دانشگاه پیام نور تنکابن، مازندران. (نویسنده مسئول)
2 استادیار، گروه علم اطلاعات و دانش شناسی، دانشگاه پیام نور، تهران، ایران
doi
10.22034/popsci.2022.306089.1130چکیده
مقدمه: در عصرحاضر، حجم عظیمی از اطلاعات موجود در محیط وب، اسناد و مقالات متنی هستند. متن کاوی، روشی برای استخراج اطلاعات غیرساختیافته و نیمهساختیافته از این حجم اطلاعات موجود در اینترنت و نیز، فرآیند استخراج دانش و الگوهای ناشناخته و غیرقابل فهم و بالقوه، از میان انبوه مجموعههای دادههای متنی است.روشها: این پژوهش از نوع مطالعات کتابخانهای است. با اینکه روشهای متنکاوی اکثراً بر روی منابع لاتین انجام گرفته-اند، اما با جستجو در پایگاههای اطلاعاتی فارسی، درمییابیم طی یک دهه گذشته، موضوع متنکاوی برای محققان ایرانی به-خصوص دانشجویان رشتههای علوم کامپیوتر و فناوری اطلاعات، اهمیتی دوچندان پیدا کرده است؛ به طوری که بخش قابل توجهی از مقالات کنفرانسهای مربوط به علوم و فنون کامپیوتر را مقالات مربوط به این حوزه تشکیل میدهند.یافتهها: یافتههای پژوهش نشان میدهد که متنکاوی، کاربردی از دادهکاوی است و تفاوت اصلی این دو، استخراج الگوها از متنی با زبان طبیعی در متن کاوی است درحالیکه دادهکاوی بر روی پایگاه دادههای ساختیافته عمل میکند. فرایندهای متنکاوی دارای دو فاز اصلی پیشپردازش مستندات و استخراج دانش هستند. تاکنون هشت تکنیک نیز برای متنکاوی معرفی شده است که عبارتنداز: استخراج اطلاعات، بازیابی اطلاعات، خلاصهسازی متن، طبقهبندی، خوشهبندی، بصری-سازی، پردازش زبان طبیعی و عقیدهکاوی.نتیجهگیری: در سالیان اخیر، توجه بسیار زیادی در حوزه بینالمللی و ملی به متنکاوی شده است. افزایش چشمگیر دادههای متنی، پژوهشگران را بر آن داشته است که به دنبال روشهایی جهت کاوش در این دادهها باشند. طبیعی است که محققان ایرانی نیز ازین امر مستنثنا نبودهاند. متنکاوی به همراه تمامی روشها و تکنیکهای آن، کوششی است که پژوهشگران را در استخراج دانش و اطلاعات مفید و باارزش از انبوه متون غیرساختیافتهای که در محیط اینترنت پراکندهاند، یاری میکند.