مجموعهداده چندسطحی فارسی برای بازیابی اطلاعات
نویسندگان
1 دکتری تخصصی مهندسی کامپیوتر دانشیار؛ دانشکده مهندسی کامپیوتر؛ دانشگاه اصفهان.
2 دکتری تخصصی مهندسی کامپیوتر دانشیار؛ دانشکده مهندسی کامپیوتر؛ دانشگاه اصفهان.
3 کارشناسی ارشد مهندسی کامپیوتر؛ دانشکده مهندسی کامپیوتر؛ دانشگاه اصفهان.
doi
10.22034/jipm.2024.710246چکیده
هر سامانة بازیابی اطلاعات وظیفه دارد با دریافت یک پُرسه، اسناد مرتبط با آن پُرسه را بازیابی کند. این بازیابی از میان مجموعهای بزرگ از هزاران تا میلیونها سند انجام میشود. در سالهای اخیر، پژوهشهای زیادی برای توسعة سامانههای بازیابی اطلاعات با استفاده از مدلهای زبان انجام شده است؛ اما در این زمینه، پژوهشی برای زبان فارسی یافت نشد. یکی از علتهای اصلی این امر، نبودِ یک مجموعهدادة فارسی مناسب برای آموزش مدلهای زبان است. در این پژوهش، ابتدا یک مجموعهدادة بازیابی اطلاعات فارسی ارائه شده و پس از آن، روشهایی برای غنیسازی این مجموعهداده مورد بحث قرار گرفته است. این غنیسازی با کمک چندسطحی کردن ارتباط میان پُرسه و سند انجام میشود؛ به نحوی که مجموعهدادة جدید میتواند رابطه بین پُرسه و سند را بهجای دو سطح (کاملاً نامرتبط، کاملاً مرتبط) در چهار سطح (نامرتبط، مرتبط، بسیار مرتبط، و کاملاً مرتبط) نشان دهد. مجموعهداده ایجادشده PersianMLIR نام دارد. آزمایشها بیانگر بهبود عملکرد سامانه، هم برای زبان فارسی و هم برای زبان انگلیسی است و این میزان بهبود برای زبان فارسی 87/1 درصد است.