کاربرد رویکرد یادگیری حساس به هزینه برای پیش‌بینی کلاس‌های نامتعادل خاک

نویسندگان

1 دانش آموخته دکتری، گروه علوم خاک، دانشکده کشاورزی، دانشگاه زنجان، ایران

2 استادیار موسسه تحقیقات خاک و آب، سازمان تحقیقات، آموزش و ترویج کشاورزی، کرج، ایران.

3 دانشیار، گروه علوم خاک، دانشکده کشاورزی، دانشگاه زنجان، ایران

doi
10.22069/ejsms.2025.22001.2128
چکیده

سابقه و هدف: مدیریت بهینه خاک و توسعه پایدار کشاورزی، نیاز به دسترسی اطلاعات دقیق و معتبر در مورد وضعیت و طبقه‌بندی خاک دارد و پیش‌بینی دقیق کلاس‌های خاک و تعیین مکانی آن‌ها از اهمیت بالایی برخوردار است. استفاده از روش‌های یادگیری ماشین و به‌خصوص رویکرد یادگیری حساس به هزینه می‌تواند با در نظر گرفتن نامتوازنی در توزیع کلاس‌های خاک، به بهبود دقت و کارایی پیش‌بینی کلاس‌های خاک کمک کرده و اطلاعات ارزشمندی برای مدیریت بهینه خاک و کشاورزی فراهم کند. با این هدف، این مطالعه در بخشی از اراضی جنوب غربی استان زنجان انجام شد.مواد و روش‌ها: تعداد 148 خاک‌رخ با روش الگوی شبکه‌بندی منظم و میانگین فاصله 500 متر حفر، تشریح و با تجزیه‌وتحلیل آزمایشگاهی تا سطح فامیل رده‌بندی شد. متغیرهای محیطی شامل اطلاعات نقشه‌های ژئومورفولوژی و زمین‌شناسی، مدل رقومی ارتفاع و داده‌های حاصل از تصاویر ماهواره‌ای لندست 8 بودند که بر اساس نظر کارشناسی و رویکرد تحلیل مؤلفه اصلی تعدادی از متغیرهای محیطی شامل اطلاعات نقشه‌های ژئومورفولوژی، اطلاعات زمین‌شناسی، سایه‌اندازی تپه‌ها، طلوع خورشید، عمق دره، شاخص طول در جهت شیب، فاصله تا شبکه آبراهه، شاخص رطوبتی توپوگرافی و شاخص همواری بالای پشته با درجه تفکیک بالا به‌عنوان مؤثرترین متغیرهای محیطی برای پیش‌بینی کلاس‌های خاک و ورودی مدل‌ها انتخاب شد. مدل‌‌‌‌‌‌‌‌‌‌‌‌‌‌‌‌‌‌‌‌سازی رابطه خاک - زمین‌نما با استفاده از الگوریتم یادگیرنده جنگل تصادفی و رویکرد یادگیری حساس به هزینه در محیط نرم‌افزار "Rstudio" انجام شد.یافته‌ها: خاک‌های منطقه در پنج کلاس با توزیع نامتعادل تا سطح زیرگروه شامل تیپیک کلسی‌زرپتز، تیپیک هاپلوزرپتز، جیپسیک هاپلوزرپتز، تیپیک زراورتنتز و لیتیک زراورتنتز بودند. مقادیر صحت کلی و ضریب کاپا برای ارزیابی نقشه خاک در مدل جنگل تصادفی 65 درصد و 32/0 و در رویکرد یادگیری حساس به هزینه 86 درصد و 77/0 به دست آمد. مقادیر صحت‌سنجی پیش‌بینی کلاس‌های خاک در سطح زیرگروه نشان داد پس از متعادل‌سازی با رویکرد یادگیری حساس به هزینه تمامی کلاس‌های خاک به‌ویژه دو کلاس اقلیت جیپسیک هاپلوزرپتز و لیتیک زراورتنتز به ترتیب‌ با مقادیر صحت کاربر 100 درصد و صحت تولیدکننده 91 و 85 درصد، با صحت بسیار بالایی پیش‌بینی شدند. مقادیر شاخص حساسیت برای دو کلاس اقلیت جیپسیک هاپلوزرپتز (صفر) و لیتیک زراورتنتز (صفر) نشان می‌دهد که هیچ پیش‌بینی صحیحی برای این دو کلاس اقلیت انجام نگرفته است. مقادیر شاخص ویژگی برای کلاس-های جیپسیک هاپلوزرپتز و لیتیک زراورتنتز به ترتیب‌ برابر 1 و 97/0 بود. این مقادیر نشان می‌دهند که توانایی مدل جنگل تصادفی در تشخیص این دو کلاس نسبت به سایر کلاس‌ها بسیار بالاتر است. نتایج صحت متعادل نشان داد که بااینکه تشخیص مدل در تمایز کلاس‌های اقلیت جیپسیک هاپلوزرپتز و لیتیک زراورتنتز با مقادیر 50/0 و 49/0 نسبت به سایر کلاس‌ها مشکل‌تر است اما بااین‌وجود مدل می‌تواند به‌صورت نسبتاً خوب کلاس‌ها را پیش‌بینی کند.نتیجه‌گیری: نتایج مطالعه مؤید آن است که روش بهبود داده‌های نامتعادل با رویکرد یادگیری حساس به هزینه سبب افزایش دقت پیش‌بینی در کلاس‌های خاک و نقشه تولیدشده می‌شود. تمرکز مدل در روش یادگیری حساس به هزینه‌بر روی داده‌های با فراوانی کم (اقلیت) است و این موضوع، موجب کاهش خطای پیش‌بینی و افزایش دقت مدل می‌گردد. نتایج نشان داد که الگوریتم جنگل تصادفی با استفاده از رویکرد یادگیری حساس به هزینه می‌تواند بهبود معناداری در تمایز دادن کلاس‌های خاک به‌ویژه کلاس‌های اقلیت داشته باشد.