تشخیص جهش گیرنده رشد اپیدرمی در بیماران مبتلا به سرطان ریه سلول‌های غیرکوچک با استفاده از یک چارچوب یادگیری بازنمایی نظارت شده

نویسندگان

1 گروه ریه، مجتمع بیمارستانی امام خمینی (ره)، دانشگاه علوم پزشکی تهران، تهران، ایران

2 گروه مهندسی پزشکی، دانشکده مهندسی برق، دانشگاه صنعتی خواجه نصیرالدین طوسی، تهران، ایران

3 خواجه‌نصیرالدین‌طوسی

doi
10.22041/ijbme.2025.2070816.1995
چکیده

سرطان ریه یکی از شایع‌ترین سرطان‌های شناخته شده در جهان است که از مهم‌ترین علل مرگ ‌و میر ناشی از سرطان محسوب می‌شود. شناسایی دقیق و خودکار جهش‌های ژنتیکی، به‌ویژه در گیرنده‌ی فاکتور رشد اپیدرمی (EGFR)، برای انتخاب درمان‌های هدفمند و بهبود شرایط بالینی در بیماران مبتلا به سرطان ریه سلول‌های غیر کوچک (NSCLC) ضروری است. در سال‌های اخیر، شناسایی جهش‌های ژنتیکی با استفاده از روش‌های یادگیری ماشین به افق‌های روشنی دست یافته است. با این حال، ناهمگونی داده‌ها و عدم‌ توازن کلاس‌ها از چالش‌های مهمی هستند که منجر به کاهش عملکرد مدل‌ها می‌شود. در این مطالعه، یک چارچوب یادگیری بازنمایی نظارت‌شده به‌منظور پردازش داده‌های بالینی ناهمگون شامل ویژگی‌های عددی و دسته‌ای ارائه شده است. در این چارچوب، ویژگی‌های دسته‌ای ابتدا از طریق یک لایه تعبیه آموزش‌پذیر رمزگذاری می‌شوند، در حالی که داده‌های عددی از طریق یک لایه نرمال‌سازی پیش‌پردازش می‌شوند. سپس، داده‌های پردازش شده عددی و دسته‌ای با یکدیگر ادغام شده و توسط یک لایه اتصال کامل نگاشت می‌شوند تا بازنمایی‌های غیرخطی و موثر از مجموعه دادگان به دست آید. در نهایت، برای مقابله با مشکل عدم‌توازن کلاس‌ها و افزایش دقت در شناسایی نمونه‌های کلاس اقلیت، از یک دسته‌بند XGBoost وزن‌دهی شده استفاده شد که با تخصیص وزن‌های متفاوت به کلاس‌ها، امکان شناسایی جهش‌های نادر را فراهم می‌کند. کارایی روش پیشنهادی بر مجموعه‌دادهNSCLC Radiogenomics شامل ۲۱۱ بیمار از پایگاه TCIA با اعتبارسنجی متقابل پنج ‌فولد متوازن ارزیابی شد. روش پیشنهادی به دقت 80/9%، حساسیت 72/2%، اختصاصیت 83/7%، F1-score %62/6، precision %66/5 مساحت زیر منحنی (AUC) 0/82 دست یافت. مقایسه با الگوریتم‌های موجود نشان داد که روش پیشنهادی، شناسایی جهش‌های EGFR را در داده‌های بالینی ناهمگون و نامتوازن به‌طور قابل توجهی بهبود می‌دهد.