تعیین آرایش بهینه یگان ها با استفاده از یادگیری تقویتی چند عاملی در بازی جنگ

نویسندگان

1 دانشگاه صنعتی امیرکبیر

2 دانشگاه صنعتی امیرکبیر.

3 دانشگاه صنعتی امیرکبیر.

4 دانشگاه صنعتی امیرکبیر

doi
چکیده

در این مقاله، به مسئله یادگیری تقویتی چندعاملی با کاربرد در باز یجنگ پرداخته شده است. ساختارهای نظامی باعث ایجاد اولویت در اجرای تصمیمات بین عامل های درگیر در صحنه نبرد می شود. حالت های استاتیک تصمیم گیری بین عامل ها در این ساختارهای را می توان در قالب بازی های بسیط بیان کرد. فرآیند مزبور در چارچوب بازیهای مارکوف بسیط مدل شده که عمل مشترک بهینه از طریق محاسبه نقطه تعادل نش کامل زیربازی به دست می آید. با استفاده از مفهوم ارزشهای انجمنی، امکان ایجاد مصالحه در انتخاب عمل بهینه نقطه تعادل نش و اکتشاف عمل های جدید فراهم شده است. شبیه سازی انجام شده بر روی نسخه ساد های از یک باز یجنگ واقعی، علاوه بر تا یید همگرایی، کارآمدی این روش را در بررسی پدیده های مختلف جنگ نشان میدهد