طراحی سازوکار تدارکات براساس یادگیری Q و با سیاست انتخاب عمل مبتنی بر الگوریتم ازدحام ذرات

نویسندگان

1 دانشگاه تربیت مدرس

2 دانشگاه تربیت مدرس

doi
چکیده

در این مقاله، مسئله مناقصه در یک شرکت خودروسازی برای تدارک قطعات مورد نیاز از تأمین‌کنندگان بالقوه از طریق الگوریتم یادگیری Q حل شده‌است. در این مسئله، خریدار با توجه به پیشنهادات دریافتی از تأمین‌کنندگان بالقوه که شامل قیمت و زمان تحویل پیشنهادی است، سفارش قطعات مورد نیاز خود را به تأمین‌کنندگان تخصیص می‌دهد. هدف خریدار کمینه‌سازی هزینه‌های تدارکات از طریق یادگیری از مناقصات پیشین است. این مسئله به­ صورت یک مسئله تصمیم‌گیری مارکوفی تعریف شده است که در آن هر عمل وابسته به عمل و وضعیت قبلی است. برای حل این مسئله یک الگوریتم یادگیری تقویتی به نام الگوریتم یادگیری Q توسعه داده شده است که در آن از الگوریتم بهینه­سازی ازدحام ذرات به ­عنوان راهکاری برای یافتن و انتخاب سیاست بهینه برای انتخاب عمل در الگوریتم یادگیری Q استفاده شده‌است. در مقایسه این الگوریتم با حالتی که در آن سیاست انتخاب عمل مطابق با یک الگوریتم حریصانه است، این الگوریتم بسیار کارآمدتر است.