ارائه الگوریتمی جهت تسریع روش تکرار سیاست در راستیآزمایی فرآیندهای تصمیم مارکوف با استفاده از یادگیری ماشین
نویسندگان
1 گروه علوم کامپیوتر، دانشکده علوم ریاضی، دانشگاه ولیعصر رفسنجان، رفسنجان، ایران
doi
10.22052/scj.2023.243360.1029چکیده
فرآیندهای تصمیم مارکوف در هوش مصنوعی و راستیآزمایی رسمی برای مدلسازی سیستمهای کامپیوتری که دارای رفتارهای تصادفی و غیرقطعی هستند، استفاده میشوند. دو دسته مهم از ویژگیهایی که در وارسی مدل احتمالاتی استفاده میشوند شامل احتمال بهینه رسیدن به حالت هدف و پاداش انباشته شده مورد انتظار هستند. تکرار مقدار و تکرار سیاست دو روش عددی تکراری شناخته شده برای تقریب مقادیر بهینه هستند. چالش اصلی این روشها زمان اجرایی بالای آنها است. در این مقاله روشی جدید برای تسریع همگرایی به سیاست بهینه ارائه میشود که زمان اجرایی روش تکرار سیاست را کاهش میدهد. این روش بر پایه استفاده از یادگیری ماشین برای تخمین یک سیاست نزدیک به بهینه است. برای هر کلاس از مدلهای فرآیند تصمیم مارکوف، تعدادی مدل کوچک را برای مرحله آموزش و ساخت دستهبند در نظر میگیریم. دستهبند ساخته شده در فرآیند یادگیری، برای پیشبینی کنش بهینه هر حالت فرآیند تصمیم مارکوف داده شده به کار میرود. این دستهبند همچنین برای پیشنهاد یک سیاست نزدیک به بهینه برای فرآیندهای تصمیم مارکوف بزرگ از همان دسته مدلها، استفاده میشود تا زمان مصرفی کل را کاهش دهد. پیادهسازی روش ارائه شده در وارسیگر مدل PRISM نشان میدهد زمان اجرا به طور میانگین ۵۰ درصد کاهش مییابد.