یادگیری تقویتی معکوس مبتنی بر رویداد برای اجماع رهبر-پیرو بهینه تطبیقی سیستمهای چندعاملی ناشناخته
نویسندگان
1 دانشجوی دکتری، دانشکده مهندسی برق و کامپیوتر، دانشگاه سمنان، سمنان، ایران
2 دانشیار، دانشکده مهندسی برق، دانشگاه امیرکبیر، تهران، ایران
3 دانشیار، دانشکده مهندسی برق و کامپیوتر، دانشگاه سمنان، سمنان، ایران
doi
10.22034/tjee.2024.59109.4758چکیده
در این مقاله، یادگیری تقویتی معکوس مبتنی بر رویداد برای بازیهای گرافی زمان گسسته چند عاملی با دینامیک ناشناخته معرفی میشود. در مساله یادگیری تقویتی معکوس برای این بازیها، سیستم خبره و یادگیرنده هر دو یک سیستم چند عاملی رهبر-پیرو میباشند. هدف سیستم خبره هم زمانی بهینه عاملهای پیرو به عامل رهبر است. عاملهای یادگیرنده قصد دارند از حالتها و ورودیهای کنترلی عاملهای خبره تقلید کنند بطوریکه تابع ارزش خبره برای آنها ناشناخته است. یک الگوریتم یادگیری تقویتی معکوس بر مبنای برنامهریزی پویای تطبیقی برای سیستم یادگیرنده توسعه داده شده است تا تابع عملکرد ناشناخته خبره را بازسازی کند و معادلات همیلتون-ژاکوبی-بلمن مبتنی بر رویداد را بدون نیاز به هیچ دانشی از دینامیکهای سیستم خبره و یادگیرنده حل کند. برای اجرای الگوریتم ارائه شده، از ساختار شبکه عصبی نقاد-عملگر-پاداشحالت استفاده شده است و دینامیکهای ناشناخته سیستمهای چندعاملی خبره و یادگیرنده با شبکههای عصبی شناساگر تقریب زده میشوند. برخلاف برنامهریزی پویای تطبیقی سنتی که قاعده کنترل بصورت دورهای بهروز میشود، در روش ارائه شده قاعده کنترل و وزنهای شبکه عصبی فقط در لحظات رویداد بهروز میشوند. بنابراین پیچیدگی محاسباتی کاهش مییابد. در انتها، نتایج شبیهسازی برای توصیف کارایی روش پیشنهادی ارائه شده است.