تخمین داده های مفقود جریان رودخانه با استفاده از الگوریتمهای یادگیری جمعی و ماشینی (مطالعه موردی: رودخانه کرخه)
نویسندگان
1 دانشجوی دکترای تخصصی، گروه مهندسی آب و سازه های هیدرولیکی، دانشکده مهندسی عمران، دانشگاه سمنان، ایران
2 استاد، گروه مهندسی آب و سازه های هیدرولیکی، دانشکده مهندسی عمران، دانشگاه سمنان، ایران
3 دانشیار، گروه مهندسی آب و سازه های هیدرولیکی، دانشکده مهندسی عمران، دانشگاه سمنان، ایران
doi
10.22125/iwe.2025.491838.1842چکیده
در این پژوهش، از 9 الگوریتم یادگیری جمعی و ماشینی شامل الگوریتمهای Xgboost، Catboost، Extra Trees، Random Forest، M5، MLP، K-NN، Decision Tree وSVR برای تخمین دادههای مفقود جریان روزانه رودخانه کرخه استفاده شد. جهت برآورد دادههای مفقود ایستگاه عبدالخان و پای پل، دادههای جریان روزانه ایستگاه هیدرومتری حمیدیه به عنوان ایستگاه همسایه در دوره آماری 40 ساله مورد بررسی قرار گرفت. بهینهسازی فراپارامترهای الگوریتمهای مذکور، به روش Optuna انجام شد. مقایسه عملکرد مدلها نشان داد که الگوریتم Xgboost با یادگیری روابط غیرخطی پیچیده،دقت بیشتری در تخمین دادههای مفقود دارد. الگوریتم مذکور، در ایستگاههای عبدالخان و پای پل، با داشتن بیشترین مقدار ضریب تعیین (R2) به ترتیب برابر با 95/0 و 78/0 و کمترین مقدار میانگین خطای مطلق (MAE) بترتیب برابر با 76/18 و 45/36 بهترین عملکرد را دارد. همچنین، کمترین مقدار ریشه میانگین مربع خطاها (RMSE) برابر با 75/43 و 87/108 بهدست آمد.علاوه براین، الگوریتم Xgboost کمترین مقدار مجذور میانگین مربعات خطای نسبی (RRMSE) برابر با 20/0 و 46/0 ثبت کرد.بنابراین، الگوریتم Xgboost بیشترین کارایی را در تخمین دادههای مفقود نسبت به بقیه مدلها در هر دو ایستگاه دارد. همچنین، میتواند بر چالشهای مکانی و دادههای محدود غلبه کند. نتایج نمودار تیلور نیز حاکی از برتری مدل Xgboost در هر دو ایستگاه مذکور است. مدل Catboost نیز در ایستگاههای عبدالخان و پای پل به ترتیب 11% و 5% دقت کمتر از مدل Xgboost داشت و دومین جایگاه را میان مدلهای بررسیشده کسب کرد .نتایج این پژوهش میتواند جهت تخمین جریان رودخانه در سایر ایستگاههای فاقد آمار مفید واقع شود.