کاربرد الگوریتمهای نمونهگیری در طبقهبندی دادههای ژئوشیمیایی نامتوازن: مطالعه موردی؛ دادههای ژئوشیمیایی برگه 1:100000 قاین
نویسندگان
1 گروه مهندسی معدن، دانشگاه صنعتی بیرجند، بیرجند، ایران
doi
10.22034/anm.2025.22666.1661چکیده
دادههای ژئوشیمیایی ماهیت نامتوازن (یعنی تعداد نمونهها با عیار کم یا کلاس زمینه زیاد و تعداد نمونهها با عیار بالا یعنی کلاس آنومالی کم) دارند. طبقهبندی این دادهها، منجر به ایجاد مدلی اریبدار (کم شدن احتمال تعلق نمونههای جدید به کلاسهایی با نمونههای کمتر) همراه با کاهش دقت و صحت مدل خواهد شد. در این مقاله، سه دسته الگوریتم نمونهگیری افزایشی، نمونهگیری کاهشی و نمونهگیری ترکیبی برای متوازنسازی دادهها معرفی شده است. همچنین عملکرد این الگوریتمها بر روی دادههای ژئوشیمیایی رسوبات آبراههای برگه قاین توسط دو روش طبقهبندی ماشین بردار پشتیبان و شبکه عصبی مصنوعی بررسی شده است. نتایج نشان میدهند که متوازنسازی دادهها (رساندن نسبت تعداد نمونههای کلاس زمینه به کلاس آنومالی از 3/6 با 1) میتوان افزایش قابلتوجهی در کمیت سنجههای ماتریس درهمریختگی مثل صحت، حساسیت، وضوح، دقت، امتیاز-F، مقدار-F، میانگین-G و سطح زیر منحنی ROC (به میزان 10 تا 50 درصد) و کاهش حدود 10 درصدی در سنجه خطا ایجاد نماید. بهطوریکه الگوریتمهای نمونهگیری افزایشی، ترکیبی و کاهشی به ترتیب بالاترین عملکرد را دارند. همچنین نقشههای آنومالیهای ژئوشیمیایی مدلسازی شده توسط الگوریتمهای متوازنسازی در منطقه موردمطالعه نشان میدهد که این مدلها میتوانند ضمن افزایش وسعت آنومالیهای ژئوشیمیایی، همپوشانی خوبی بین این آنومالیها با واحدهای سنگی حاوی کانیسازی برقرار نمایند. در این خصوص، الگوریتمهای نمونهگیری افزایشی و سپس الگوریتم نمونهگیری ترکیبی از عملکرد بالاتری برخوردار هستند؛ بنابراین پیشنهاد این مقاله استفاده از الگوریتمهای متوازنسازی دادههای (بهکارگیری الگوریتمهای نمونهگیری افزایشی و سپس الگوریتمهای نمونهگیری ترکیبی) قبل از طبقهبندی دادههای اکتشافی است.