مجموعه‌داده چندسطحی فارسی برای بازیابی اطلاعات

نویسندگان

1 دکتری تخصصی مهندسی کامپیوتر دانشیار؛ دانشکده مهندسی کامپیوتر؛ دانشگاه اصفهان.

2 دکتری تخصصی مهندسی کامپیوتر دانشیار؛ دانشکده مهندسی کامپیوتر؛ دانشگاه اصفهان.

3 کارشناسی ارشد مهندسی کامپیوتر؛ دانشکده مهندسی کامپیوتر؛ دانشگاه اصفهان.

doi
10.22034/jipm.2024.710246
چکیده

هر سامانة بازیابی اطلاعات وظیفه دارد با دریافت یک پُرسه، اسناد مرتبط با آن پُرسه را بازیابی کند. این بازیابی از میان مجموعه‌ای بزرگ از هزاران تا میلیون‌ها سند انجام می‌شود. در سال‌های اخیر، پژوهش‌های زیادی برای توسعة سامانه‌های بازیابی اطلاعات با استفاده از مدل‌های زبان انجام شده است؛ اما در این زمینه، پژوهشی برای زبان فارسی یافت نشد. یکی از علت‌های اصلی این امر، نبودِ یک مجموعه‌دادة فارسی مناسب برای آموزش مدل‌های زبان است. در این پژوهش، ابتدا یک مجموعه‌دادة بازیابی اطلاعات فارسی ارائه شده و پس از آن، روش‌هایی برای غنی‌سازی این مجموعه‌داده مورد بحث قرار گرفته است. این غنی‌سازی با کمک چندسطحی کردن ارتباط میان پُرسه و سند انجام می‌شود؛ به ‌نحوی که مجموعه‌دادة جدید می‌تواند رابطه بین پُرسه و سند را به‌جای دو سطح (کاملاً نامرتبط، کاملاً مرتبط) در چهار سطح (نامرتبط، مرتبط، بسیار مرتبط، و کاملاً مرتبط) نشان دهد. مجموعه‌داده ایجادشده PersianMLIR نام دارد. آزمایش‌ها بیانگر بهبود عملکرد سامانه، هم برای زبان فارسی و هم برای زبان انگلیسی است و این میزان بهبود برای زبان فارسی‌ 87/1 درصد است.