انتقل إلى المحتوى الرئيسي

إعدادات البحث في الملفات

تُفتح الإعدادات من خلال زر Settings على صفحة البحث. هنا يتم تحديد الملفات التي يجب معالجتها، وكمية النص التي يجب استخراجها، وكيفية تحديد لغة الوثائق والاستفسارات. كما يمكن رؤية الجزء من الملفات الذي تم إدراجه في الفهرس، ويمكن بدء إعادة الفهرسة.

معلومات

لا توجد زر "حفظ" عام في الصفحة — يتم تطبيق كل تغيير على الفور بعد إدخال القيمة، أو الاختيار من القائمة، أو تبديل خانة الاختيار.

الصفحة وزر Settings متاحان للمسؤولين الذين لديهم حق إدارة فهرس الملفات، ولا يمكن تغيير القيم إلا من قبل من لديه أيضًا حق تعديل الإعدادات العامة؛ بدون ذلك، تكون الحقول متاحة فقط للعرض. لمزيد من التفاصيل — في قسم «الوصول إلى القسم».

قدرات المشروع​

تظهر كتلة Project capabilities ما هو متاح للمشروع. إنها فقط للإعلام — لا يمكن تغيير هذه القيم هنا. كل سطر مُعَلَّم برمز: ✓ — الإمكانية متاحة، ✕ — غير متاحة.

  • Feature included in tariff — هل الوظيفة مدرجة في تعريفة المشروع.
  • Text extraction service available — هل استخراج النص من الملفات متاح. إذا لم يكن كذلك، يتم الإشارة إلى السبب بجانبه: عنوان الخدمة غير محدد، أو الخدمة رفضت الطلب، أو الخدمة لا تستجيب.
  • OCR available — هل التعرف على المسح الضوئي متاح.
  • Vector search available — هل البحث المتجه متاح.

إذا كانت الإمكانية غير متاحة، تظل الإعدادات المرتبطة بها مرئية أدناه، ولكنها محجوزة: على سبيل المثال، بدون وظيفة في التعريفة، لا يمكن تفعيل معالجة الملفات، وبدون OCR — لا يمكن إعداد التعرف.

معالجة محتويات الملفات​

تُفعّل خانة الاختيار في عنوان كتلة Processing file contents معالجة محتوى الملفات. بشكل افتراضي، تكون المعالجة مُعطَّلة. إيقاف المعالجة يوقف استخراج النص من الملفات الجديدة، ولكن الفهرس الذي تم بناؤه بالفعل يبقى محفوظًا ولا يزال يمكن البحث فيه.

في الكتلة، يتم إعداد:

  • Formats for extraction — تنسيقات الملفات التي يتم استخراج النص منها: txt, md, html, pdf, docx, odt, epub, rtf. بشكل افتراضي، يتم اختيار جميعها.
  • Sections whose files are indexed — الأقسام التي تدخل ملفاتها في الفهرس: Products, Pages, Blocks, Slides, Templates, Discounts, Forms, Events, User Groups, Users, Admins.
  • Maximum characters per file — عدد الأحرف التي يتم استخراجها من ملف واحد: من 10000 إلى 2000000، بشكل افتراضي 500000. النص الذي يتجاوز الحد لا يدخل الفهرس، ويعتبر الملف مقطوعًا. تحت الحقل، يتم عرض عدد الملفات التي يمكن أن يستوعبها حجم الفهرس المسموح به عند الحد الحالي.
الوثائق الشخصية

تحتوي الأقسام Users, User Groups و Admins على مستندات العملاء والمسؤولين. إذا تم اختيارها، تحذر الكتلة: نص هذه الملفات سيصبح متاحًا للبحث للجميع، الذين لديهم حق البحث والوصول إلى القسم.

OCR (التعرف على المسح الضوئي)​

تتولى كتلة OCR (scan recognition) مسؤولية التعرف على النص في المسحات. تُفعّل خانة الاختيار في عنوان الكتلة التعرف، ويحدد الحقل Maximum pages per file عدد الصفحات التي يمكن التعرف عليها من ملف واحد: من 1 إلى 500، بشكل افتراضي 50.

إذا كان التعرف غير متاح للمشروع، تكون خانة الاختيار والحقل محجوزين، وتظهر تحذير في الكتلة. يمكن التعرف على مسح ضوئي منفصل يدويًا — في قائمة الملفات المفهرسة.

لغة الوثائق والاستفسارات​

تحدد كتلة Language of documents and queries اللغة التي تتم معالجة الوثائق والاستفسارات بها.

  • Document language detection — كيف يتم تحديد لغة الوثيقة: Automatic (بشكل افتراضي) أو Fixed.
  • Default language — لغة الوثائق: russian, english (بشكل افتراضي), german, french أو simple.
  • Query language resolution — كيف يتم تحديد لغة الاستفسار: Automatic (بشكل افتراضي)، Fixed أو All corpus languages — البحث عبر جميع اللغات الموجودة بين الملفات المفهرسة.

توجد أدناه خانتان للاختيار، بشكل افتراضي كلاهما مفعلتان:

  • Allow manual file language override — السماح بتعديل لغة ملف منفصل يدويًا؛
  • Search by part of a word — يجد التكرارات داخل الكلمة، لكنه يعمل بشكل أبطأ بشكل ملحوظ.

تغطية الفهرس​

تظهر كتلة Index coverage حالة الفهرس:

  • عدد الملفات المتاحة للبحث من العدد الإجمالي؛
  • عدد الملفات التي تنتظر خدمة استخراج النص؛
  • عدد الملفات بتنسيق غير مدعوم؛
  • عدد الملفات التي تمت معالجتها بخطأ؛
  • عدد الملفات المقطوعة حسب حد الأحرف؛
  • عدد الملفات التالفة؛
  • عدد الملفات المستبعدة من البحث يدويًا؛
  • عدد الملفات التي تحتوي على نص مشكوك فيه — تظهر السطر فقط إذا كانت هناك مثل هذه الملفات.

كل رقم هو رابط إلى قائمة الملفات المفهرسة مع الفلتر المطبق بالفعل. إذا لم يتم العثور على الوثيقة من خلال البحث، يمكن رؤية السبب على الفور من خلال هذه الروابط: التنسيق غير مدعوم، أو انتهى استخراج النص بخطأ، أو تم قطع النص.

تحت العدادات، يتم عرض حجم الفهرس بالميغابايت ونسبته من الحجم المسموح به كنسبة مئوية.

تحذير

إذا تم استنفاد الحجم المسموح به للفهرس، تحذر الكتلة: لن يتم قبول مستندات جديدة للمعالجة، وسيستمر البحث في الفهرس الذي تم بناؤه بالفعل. إعادة الفهرسة في هذه الحالة لن تساعد — يجب تحرير المساحة أو زيادة الحجم.

إذا تم تعليق الاستخراج من قبل مشغل المنصة، تُبلغ الكتلة بذلك أيضًا. هذه الفترة لا تُرفع بواسطة خانة الاختيار Processing file contents؛ المهام المعينة لا تضيع وستستمر بعد رفع التعليق.

إعادة الفهرسة​

لإعادة معالجة الملفات، اختر من القائمة What to reindex، أي الملفات يجب معالجتها:

  • Only unprocessed — فقط غير المعالجة (القيمة الافتراضية)؛
  • Only failed — فقط التي انتهت بخطأ؛
  • Truncated and stale — المقطوعة والقديمة؛
  • Entire corpus — جميع الملفات.

ثم اضغط على Rebuild index. ستظهر تحت الزر شريط تقدم إعادة الفهرسة: أولاً، يتم وضع الملفات في قائمة الانتظار، ثم يتم عرض النسبة وعدد الملفات المعالجة من الإجمالي. بينما تستمر إعادة الفهرسة، يكون الزر غير نشط. إذا لم يكن هناك ملفات في الشريحة المختارة، يتم عرض رسالة "Nothing to reindex" بدلاً من الشريط. تبقى نتيجة آخر إعادة فهرسة — النسبة وعدد الملفات المعالجة من الإجمالي — تحت الزر حتى بعد الانتهاء منها.

تحذير

إذا كانت معالجة محتوى الملفات مُعطَّلة في كتلة Processing file contents، ستدخل الملفات في قائمة الانتظار، ولكن لن تتم معالجتها حتى يتم تفعيل المعالجة. زر Rebuild index متاح فقط للمسؤولين الذين لديهم حق إدارة فهرس الملفات.