هدایت و کنترل خودمختار ملاقات مداری با شش درجه آزادی با استفاده از فرایادگیری تقویتی و شبکههای ترنسفورمر
نویسندگان
1 دانشکده برق و کنترل ، دانشگاه صنعتی مالکاشتر،
2 عضو هیئت علمی دانشکده برق دانشگاه صنعتی مالک اشتر
doi
چکیده
افزایش تعداد ماهوارهها در مدار پایین زمین، خطر برخورد بین اجسام فضایی را بهشدت افزایش داده است. مأموریتهای سرویسدهی و حذف زبالههای فضایی میتوانند با افزایش عمر ماهوارهها و پاکسازی مدارها، این تهدید را کاهش دهند. در این پژوهش، یک رویکرد نوین برای هدایت و کنترل فضاپیما در سناریوهای ملاقات مداری با شش درجه آزادی ارائه شده است که مبتنی بر یادگیری تقویتی فرا-آموزشی و شبکههای ترنسفورمر است. این مدل با کمک شبکههای ترنسفورمر، امکان یادگیری روابط پیچیده زمانی و استنباط اطلاعات پنهان از محیط را برای فضاپیمای تعقیبکننده فراهم میکند. الگوریتم بهینهسازی سیاست مجاورتی (PPO) که برای آموزش مدل بهکار گرفته شده، در کنترل پیوسته عملکرد بالایی دارد. نتایج شبیهسازیها در محیط مجازی نشان میدهند که این رویکرد از لحاظ دقت و پایداری بر معماریهای سنتی مانند LSTM برتری دارد. از سوی دیگر تعداد پارامترهای شبکه، خود چالشی مهم در پیاده سازی بر روی سخت افزارها هست که روش پیشنهادی با کاهش محسوس در تعداد پارامترهای شبکه در کنار افزایش انطباقپذیری و بهبود دقت در شرایط متغیر محیطی کمک می کند. این رویکرد میتواند بهعنوان راهکاری مؤثر برای تسهیل مأموریتهای سرویسدهی و مدیریت زبالههای فضایی مورد استفاده قرار گیرد.