تخمین داده های مفقود جریان رودخانه با استفاده از الگوریتم‌های یادگیری جمعی و ماشینی (مطالعه موردی: رودخانه کرخه)

نویسندگان

1 دانشجوی دکترای تخصصی، گروه مهندسی آب و سازه های هیدرولیکی، دانشکده مهندسی عمران، دانشگاه سمنان، ایران

2 استاد، گروه مهندسی آب و سازه های هیدرولیکی، دانشکده مهندسی عمران، دانشگاه سمنان، ایران

3 دانشیار، گروه مهندسی آب و سازه های هیدرولیکی، دانشکده مهندسی عمران، دانشگاه سمنان، ایران

doi
10.22125/iwe.2025.491838.1842
چکیده

در این پژوهش، از 9 الگوریتم یادگیری جمعی و ماشینی شامل الگوریتم‌های Xgboost، Catboost، Extra Trees، Random Forest، M5، MLP، K-NN، Decision Tree وSVR برای تخمین داده‌های مفقود جریان روزانه رودخانه کرخه استفاده شد. جهت برآورد داده‌های مفقود ایستگاه عبدالخان و پای پل، داده‌های جریان روزانه ایستگاه هیدرومتری حمیدیه به عنوان ایستگاه همسایه در دوره آماری 40 ساله مورد بررسی قرار گرفت. بهینه‌سازی فراپارامترهای الگوریتم‌های مذکور، به روش Optuna انجام شد. مقایسه عملکرد مدل‌ها نشان داد که الگوریتم Xgboost با یادگیری روابط غیرخطی پیچیده،دقت بیشتری در تخمین داده‌های مفقود دارد. الگوریتم مذکور، در ایستگاه‌های عبدالخان و پای پل، با داشتن بیشترین مقدار ضریب تعیین (R2) به ترتیب برابر با 95/0 و 78/0 و کمترین مقدار میانگین خطای مطلق (MAE) بترتیب برابر با 76/18 و 45/36 بهترین عملکرد را دارد. همچنین، کمترین مقدار ریشه میانگین مربع خطاها (RMSE) برابر با 75/43 و 87/108 به‌دست آمد.علاوه براین، الگوریتم Xgboost کمترین مقدار مجذور میانگین مربعات خطای نسبی (RRMSE) برابر با 20/0 و 46/0 ثبت کرد.بنابراین، الگوریتم Xgboost بیشترین کارایی را در تخمین داده‌های مفقود نسبت به بقیه مدل‌ها در هر دو ایستگاه دارد. همچنین، می‌تواند بر چالش‌های مکانی و داده‌های محدود غلبه کند. نتایج نمودار تیلور نیز حاکی از برتری مدل Xgboost در هر دو ایستگاه مذکور است. مدل Catboost نیز در ایستگاه‌های عبدالخان و پای پل به ترتیب 11% و 5% دقت کمتر از مدل Xgboost داشت و دومین جایگاه را میان مدل‌های بررسی‌شده کسب کرد .نتایج این پژوهش می‌تواند جهت تخمین جریان رودخانه در سایر ایستگاه‌های فاقد آمار مفید واقع شود.