کنترل تطبیقی چراغ راهنمایی با یادگیری تقویتی عمیق حساس به فاز و حافظه تجربه تفکیکی برای کاهش زمان انتظار و طول صف
نویسندگان
1 دانشگاه بیرجند
doi
10.22034/csj.2025.237381چکیده
مسئلة کنترل تطبیقی چراغ راهنمایی در شبکههای شهری بهدلیل پویایی تقاضا، ناایستایی جریان، و برهمکنش فازها چالشبرانگیز است؛ روشهای زمانبندی کلاسیک در مواجهه با عدمتعادل ورودی - خروجی و رخدادهای نادر، صفهای طولانی و زمانهای انتظار زیاد ایجاد میکنند. رویکرد پیشنهادی ما یک چارچوب سهمرحلهای یادگیری تقویتی عمیق است. ( ۱) مدلسازی وضعیت غنی شامل طول صف و تعداد خودرو هر خط، زمانانتظار تجمعی، فشار ترافیکی نرمالشده هر حرکت و حالت فعلی چراغ (امکان افزودن بازنمایی مکانی). ( ۲) تصمیمگیری حساس به فاز: برای هر فاز چراغ مسیر محاسباتی جداگانه در شبکه ارزش در نظر گرفته میشود تا تداخل گرادیان میان فازها حذف و پایداری افزایش یابد؛ سیاست با ϵ-greedy اجرا میشود. ( ۳) یادگیری با حافظة تفکیکی: تجربهها برحسب جفت فاز - اقدام در میانگیر های جدا ذخیره و با نمونهگیری متوازن آموزش داده میشوند. تابع پاداش ترکیبی از فشار، طول صف، زمانانتظار و تعداد عبوریهاست. ارزیابی روی دو مجموعهدادهها عمومی موناکو و هاربین نشان میدهد روش ما سریعتر همگرا شده و پاداش بیشتری کسب میکند. در دادههای شهر موناکو میانگین زمان انتظار نسبت به LSTM-PPO و CNN-DQN بهترتیب ۶۳ درصد و ۵۰ درصد در حالت خلوت و ۴۱ درصد و ۲۹ درصد در حالت شلوغ کاهش یافت؛ طول صف نیز ۴۴ درصد و ۲۹ درصد در حالت خلوت و ۴۲ درصد و ۳۰ درصد در حالت شلوغ کمتر شد. در دادههای شهر هاربین کاهشها برای زمان انتظار ۵۳ درصد و ۴۳ درصد در حالت خلوت و ۳۹ درصد و ۳۰ درصد در حالت شلوغ و برای طول صف ۴۳ درصد و ۲۷ درصد در حالت خلوت و ۴۴ درصد و ۳۱ درصد در حالت شلوغ بهدست آمد.