Lewati ke konten utama

Pencarian Konten File

Tab File Search di bagian Settings mengelola pencarian teks dalam file yang diunggah ke proyek: file mana yang akan diproses, seberapa banyak teks yang akan diekstrak, bagaimana menentukan bahasa dokumen dan kueri. Di sini juga terlihat bagian mana dari file yang sudah terindeks, dan Anda dapat memulai proses reindeksasi.

info

Di tab ini tidak ada tombol umum "Simpan" — setiap perubahan diterapkan segera setelah nilai dimasukkan, pilihan dari daftar, atau kotak centang diubah. Parameter dapat diubah oleh administrator yang memiliki hak untuk mengubah pengaturan umum; tanpa hak tersebut, bidang hanya tersedia untuk dilihat.

Kemampuan Proyek

Blok Project capabilities menunjukkan apa yang tersedia untuk proyek. Ini hanya memberikan informasi — nilai-nilai ini tidak dapat diubah di tab. Setiap baris ditandai dengan ikon: ✓ — kemampuan tersedia, ✕ — tidak tersedia (dengan penjelasan alasannya).

  • Apakah fungsi termasuk dalam tarif proyek.
  • Apakah layanan ekstraksi teks dari file tersedia.
  • Apakah pengenalan pemindaian (OCR) tersedia.
  • Apakah pencarian vektor tersedia.

Jika kemampuan tidak tersedia, pengaturan terkait di bawahnya tetap terlihat, tetapi terkunci: misalnya, tanpa fungsi dalam tarif, pemrosesan file tidak dapat diaktifkan, dan tanpa OCR, pengenalan tidak dapat disetel.

Memproses Konten File

Kotak centang di judul blok Processing file contents mengaktifkan pemrosesan konten file. Mematikan ini menghentikan ekstraksi teks dari file baru, tetapi indeks yang sudah dibangun tetap disimpan dan masih dapat dicari.

Di blok ini diatur:

  • Formats for extraction — format file dari mana teks diekstrak: txt, md, html, pdf, docx, odt, epub, rtf. Secara default, semua dipilih.
  • Sections whose files are indexed — bagian-bagian yang file-nya masuk ke dalam indeks: Products, Pages, Blocks, Slides, Templates, Discounts. Secara default, semua dipilih.
  • Maximum characters per file — berapa banyak karakter teks yang diekstrak dari satu file: dari 10000 hingga 2000000, secara default 500000. Teks yang melebihi batas tidak masuk ke dalam indeks, dan file dianggap terpotong. Di bawah bidang ini ditampilkan perkiraan jumlah file yang dapat ditampung oleh anggaran indeks dengan batas saat ini.

OCR

Blok OCR bertanggung jawab untuk pengenalan teks dalam pemindaian. Kotak centang di judul blok mengaktifkan pengenalan, dan bidang Maximum pages per file membatasi jumlah halaman yang dikenali dari satu file: dari 1 hingga 500, secara default 50.

Jika OCR tidak diaktifkan dalam proyek, kotak centang dan bidang terkunci, dan di blok ditampilkan peringatan.

Bahasa Dokumen dan Kueri

Blok Language of documents and queries menentukan bahasa apa yang digunakan untuk memproses dokumen dan kueri pencarian.

  • Document language detection — bagaimana bahasa dokumen ditentukan: secara otomatis (secara default) atau tetap.
  • Default language — bahasa dokumen: russian, english (secara default), german, french, atau simple.
  • Query language resolution — bagaimana bahasa kueri pencarian ditentukan: secara otomatis (secara default), tetap, atau pencarian langsung di semua bahasa yang ada di antara file yang terindeks.

Di bawahnya terdapat dua kotak centang, secara default keduanya diaktifkan:

  • izin untuk secara manual memperbaiki bahasa file tertentu;
  • pencarian berdasarkan bagian kata — proses tambahan pada dokumen yang ditemukan, yang menemukan kemunculan di dalam kata, tetapi secara signifikan memperlambat pencarian.

Cakupan Indeks

Blok Index coverage menunjukkan status indeks:

  • berapa banyak file yang tersedia untuk pencarian dari total jumlah;
  • berapa banyak file yang menunggu layanan ekstraksi teks;
  • berapa banyak file dalam format yang tidak didukung;
  • berapa banyak file yang diproses dengan kesalahan;
  • berapa banyak file yang terpotong karena batas karakter;
  • berapa banyak file yang dikecualikan dari pencarian secara manual.

Setiap angka adalah tautan ke daftar file yang terindeks dengan filter yang sudah diterapkan. Jika dokumen tidak ditemukan dalam pencarian, melalui tautan ini Anda dapat segera melihat apa penyebabnya: format tidak didukung, ekstraksi selesai dengan kesalahan, atau teks terpotong.

Di bawah penghitung ditampilkan ukuran indeks dan proporsinya dari anggaran, dalam megabyte dan persen.

Reindeksasi

Untuk memproses ulang file, pilih dari daftar What to reindex, file mana yang akan diproses:

  • hanya yang belum diproses (nilai default);
  • hanya yang selesai dengan kesalahan;
  • yang terpotong dan usang;
  • semua file.

Kemudian tekan Rebuild index. Setelah dijalankan, di bawah tombol akan muncul jumlah file yang dimasukkan dalam antrean, dan jika gagal — pesan kesalahan.

peringatan

Jika pemrosesan konten file dimatikan di blok Processing file contents, tugas reindeksasi akan antre, tetapi tidak akan dijalankan — blok memperingatkan tentang hal ini. Tombol Rebuild index hanya tersedia untuk administrator yang memiliki hak untuk mengelola indeks file.