شناسایی فاکتورهای سبک زندگی در متون زیستی پزشکی با استفاده از مدل های زبانی بزرگ
نویسندگان
1
doi
10.22034/csj.2025.520613.1091چکیده
شناسایی موجودیتهای نامگذاری شده (NER) در متون علمی، یکی از چالشهای کلیدی در پردازش زبان طبیعی است. روشهای سنتی NER، مانند مدلهای مبتنی بر یادگیری ماشین نظارت شده، به حجم بالایی از دادههای برچسبگذاری شده نیاز دارند که تهیه آنها بسیار زمانبر و پرهزینه است. در مقابل، مدلهای زبانی بزرگ (LLMs)، با کمترین نیاز به دادههای برچسبگذاری شده، فرصتی برای کاربردهای پر هزینه قبلی فراهم آوردهاند. شناسایی عوامل سبک زندگی در میلیونها مقاله علمی گذشته، یکی از این کاربردهای مغفول مانده است که میتواند موجب سازماندهی دانش موجود در زمینه ارتباط بین بیماریها و سبک زندگی شده و زمینه را برای استفاده از چنین پایگاه دانشی در سیاستهای سلامت عمومی و یا حتی درمانهای پزشکی فراهم آورد. در این مقاله برای نخستین بار یک راهکار سه مرحلهای مبتنی بر LLM به نام LSF-NER توسعه داده شده است که فاکتورهای سبک زندگی را از متون زیستی پزشکی استخراج میکند. ارزیابی نتایج آزمایشها نشان میدهد که مدل آموزش دیده در این تحقیق، علیرغم استفاده از منابع محاسباتی کمتر، عملکردی قابل مقایسه و امیدوارکننده نسبت به مدلهایی مانند GPT-4o از خود نشان داده است و نوید امکانپذیر بودن ادامه تحقیقات بدون نیاز به زیرساختهای محاسباتی پر هزینه را میدهد.