یک چارچوب یادگیری تقویتی عمیق عامل-منتقد برای تصمیم‌گیری متوالی چند هدفه

نویسندگان

1 کارشناسی ارشد، گروه مهندسی کامپیوتر، دانشگاه تربیت مدرس، تهران، ایران

2 استادیار، گروه مهندسی کامپیوتر، دانشگاه تربیت مدرس، تهران، ایران

doi
10.22034/tjee.2024.57733.4675
چکیده

تصمیم‌گیری متوالی، شرایطی را توصیف می‌کند که در آن تصمیم‌گیرنده قبل از اینکه تصمیم نهایی گرفته شود، به صورت پیاپی مشاهداتی از یک فرآیند انجام می‌دهد. در کاربردهای دنیای واقعی، مسائل تصمیم‌گیری متوالی چند هدفه رایج بوده و چالش‌های متعددی را برای پژوهشگران فراهم می‌کند. بیشتر پژوهش‌ها در این حوزه به طور سنتی بر روی موقعیت‌هایی با یک هدف تمرکز داشته‌اند و یا با ترکیب هدف‌ها به یک هدف واحد، مسئله چند هدفه را به مسئله یک هدفه تبدیل کرده‌اند. در این مقاله، یک چارچوب یادگیری تقویتی عمیق چند هدفه، "MACA" بر اساس روش عامل-منتقد ارائه شده است تا در محیط‌های پویا، هدف‌های متعارض چندگانه را در طول زمان بهینه کرده و تعادل بخشد. این چارچوب به ازای اهداف مختلف، سیاست‌های مختلفی را یاد گرفته و در نهایت این سیاست‌ها را به یک سیاست بهینه‌ی سراسری همگرا می‌کند. برای ارزیابی این چارچوب، روش پیشنهادی در مسئله‌ی سیستم‌های توصیه‌گر و برای دو هدف متناقض صحت تصمیم‌گیری (مورد پسند بودن اقلام توصیه شده برای کاربران) و انصاف (انتخاب شدن اقلام توصیه شده از همه‌ی دسته‌ها) پیاده‌سازی و با سایر روش‌های اخیر یادگیری تقویتی چند هدفه مقایسه شده است. نتایج آزمایشی روی مسئله‌ی محک (سامانه‌های توصیه‌گر) نشان می‌دهد که این چارچوب نسبت به کارهای قبلی نتایج بهتری از نظر عملکرد (صحت ۹۲.۵ و انصاف ۹۶.۵ در مجموعه داده Kiva و صحت ۹۳.۱ و انصاف ۹۷.۶ در مجموعه داده MovieLens)، زمان همگرایی و مصرف حافظه دارد. همچنین، چارچوب پیشنهادی نسبت به تعداد اهداف مقیاس‌پذیر بوده و بهینه‌سازی تعداد متغیر اهداف را امکان‌پذیر می‌کند.