بررسی کارایی رویکردهای باز نمونه‌گیری در بهبود کلاس‌بندی داده‌های نامتوازن در نقشه-برداری رقومی خاک

نویسندگان

1 گروه علوم خاک، دانشکده کشاورزی، دانشگاه گیلان، رشت، ایران

2 گروه علوم خاک، دانشکده کشاورزی، دانشگاه گیلان، رشت، ایران

3 گروه علوم خاک، دانشکده کشاورزی، دانشگاه گیلان، رشت، ایران

4 مؤسسه تحقیقات خاک و آب، سازمان تحقیقات، آموزش و ترویج کشاورزی، کرج، ایران

doi
10.22059/jrwm.2023.354333.1692
چکیده

در سال‌های اخیر، استفاده از روش‌های نقشه‌برداری رقومی مبتنی بر الگوریتم‌های یادگیری ماشین باهدف تهیه نقشه‌ کلاس‌های خاک بطور گسترده‌ای توسعه یافته است. اساس این روش‌ها پیش‌بینی کلاس‌ها یا ویژگی‌های خاک به کمک مدل‌سازی روابط بین آن‌ها و متغیرهای محیطی به عنوان نمایندگان عوامل خاک‌سازی، می‌باشد. ماهیت نامتوازن توزیع خاک‌ها در طبیعت که منجر به بیش‌برازش کلاس‌های با فراوانی زیاد و کم برازش کلاس‌های با فراوانی کم و درنتیجه کاهش دقت فرآیند نقشه‌برداری خاک شده، از چالش‌های موجود در این روش می‌باشد. بنابراین، پژوهش حاضر باهدف ارزیابی توانایی دو الگوریتم جنگل تصادفی و ماشین‌بردار‌پشتیبان در نقشه‌برداری‌رقومی کلاس‌های فامیل خاک با توزیع نامتوازن، حاصل از 95 خاک‌رخ مطالعاتی در 4000 هکتار از اراضی زیرحوضه هنام، استان لرستان انجام گرفت. در این مطالعه موضوع عدم توازن در فراوانی کلاس‌های خاک با استفاده از 6 مجموعه داده، ازجمله مجموعه داده‌های اصلی و پنج مجموعه داده ایجادشده توسط چندین رویکرد نمونه‌گیری مجدد از داده‌های اصلی، شامل دو رویکرد طبقه‌بندی دستی و سه الگوریتم بیش‌نمونه‌گیری و کم‌نمونه‌گیری و بیش‌نمونه‌گیری اقلیت مصنوعی در محیط نرم افزار R موردبررسی قرار گرفت. نتایج نشان داد علیرغم مقایر پائین آماره‌های اعتبارسنجی، شباهت گسترش خاک‌های با فراوانی زیاد در منطقه مطالعاتی در نقشه‌های حاصل از مدل جنگل تصادفی و مجموعه داده‌های اصلی و همچنین الگوریتم بیش‌نمونه‌گیری اقلیت مصنوعی با نقشه خاک تهیه‌شده به روش مرسوم قابل‌توجه می‌باشد. بنابراین فراوانی کم سایر کلاس‌های خاک و در نتیجه آن عدم آموزش درست مدل‌ها برای آن‌ها را می‌توان یکی از دلایل اصلی صحت‌کلی کم مدل‌های به‌کار‌رفته دانست.