تولید خودکار متن فارسی با استفاده مدل‌های مبتنی بر قاعده و تعبیه واژگان

نویسندگان

1 دانشجوی دکتری، دانشگاه صنعتی امیرکبیر، تهران، ایران

2 استادیار، دانشگاه صنعتی مالک‌اشتر، تهران، ایران

doi
چکیده

تولید زبان طبیعی از پردازش زبان طبیعی حاصل می‏شود. زبان طبیعی از یک سیستم ارائه ماشینی مانند پایگاه دانش تولید می‏شود. سیستم‏های NLG از مدت‏ها پیش وجود داشته اما فنّاوری آن به صورت ابزار تجاری اخیراً به‌صورت گسترده به وجود آمده است. در NLG، سیستم نیاز به تصمیم‏گیری در مورد چگونگی قرار دادن یک مفهوم در کلمات دارد. توانایی ایجاد متن معنی‌دار نقش کلیدی در بسیاری از کاربردهای پردازش زبان طبیعی مانند ترجمه ماشین، گفتار و تبدیل عکس به متن دارد. هدف این پروژه ارائه روشی برای تولید متن با استفاده از روش‌های هوش مصنوعی و با ساختار درست و آغازی برای تولید متن فارسی است. به عبارت دیگر در این مقاله روشی ارائه شده که قادر به تولید متن طولانی متنوع علاوه بر حفظ معنا و ساختار در زبان فارسی می­باشد. جهت پیشبرد تولید متن سعی شده از ترکیب روش­های یادگیری ماشین با مدل­های احتمالاتی، استفاده شود. در مدل پیشنهادی از مدل­های احتمالاتی برای استخراج قوانین و از Word2vec برای برداری­سازی متن استفاده شده و سپس در فاز تولید از ترکیب این دو و فاصله کسینوسی استفاده می­شود. نتایج نشان‌دهنده ارائه مدلی بوده که متن تولیدی آن دارای ساختار، مفهوم و تنوع مناسب می­باشد. همچنین این مدل از نظر انسانی و پیچیدگی نیز بهینه می‌باشد.