Aller au contenu principal

Recherche dans le contenu des fichiers

L'onglet File Search dans la section Settings gère la recherche dans le texte des fichiers téléchargés dans le projet : quels fichiers traiter, combien de texte en extraire, comment déterminer la langue des documents et des requêtes. On peut également voir quelle partie des fichiers a déjà été indexée et lancer une réindexation.

info

Il n'y a pas de bouton « Enregistrer » général dans l'onglet — chaque modification est appliquée immédiatement après la saisie d'une valeur, la sélection dans une liste ou le changement d'une case à cocher. Seuls les administrateurs ayant le droit de modifier les paramètres généraux peuvent changer les paramètres ; sans cela, les champs sont uniquement en lecture.

Capacités du projet

Le bloc Project capabilities montre ce qui est disponible pour le projet. Il informe uniquement — ces valeurs ne peuvent pas être modifiées dans l'onglet. Chaque ligne est marquée d'une icône : ✓ — possibilité disponible, ✕ — non disponible (avec explication de la raison).

  • La fonction est-elle incluse dans le tarif du projet.
  • Le service d'extraction de texte à partir de fichiers est-il disponible.
  • La reconnaissance de scans (OCR) est-elle disponible.
  • La recherche vectorielle est-elle disponible.

Si une possibilité n'est pas disponible, les paramètres associés ci-dessous restent visibles mais sont bloqués : par exemple, sans la fonction dans le tarif, il n'est pas possible d'activer le traitement des fichiers, et sans OCR, il n'est pas possible de configurer la reconnaissance.

Traitement du contenu des fichiers

La case à cocher dans l'en-tête du bloc Processing file contents active le traitement du contenu des fichiers. La désactivation arrête l'extraction de texte à partir de nouveaux fichiers, mais l'index déjà construit est conservé et il est toujours possible de rechercher à partir de celui-ci.

Dans le bloc, on peut configurer :

  • Formats for extraction — formats de fichiers à partir desquels le texte est extrait : txt, md, html, pdf, docx, odt, epub, rtf. Par défaut, tous sont sélectionnés.
  • Sections whose files are indexed — sections dont les fichiers sont indexés : Products, Pages, Blocks, Slides, Templates, Discounts. Par défaut, toutes sont sélectionnées.
  • Maximum characters per file — combien de caractères de texte sont extraits d'un fichier : de 10000 à 2000000, par défaut 500000. Le texte au-delà de la limite n'est pas inclus dans l'index, et le fichier est considéré comme tronqué. Sous le champ, il est indiqué combien de fichiers environ le budget de l'index peut contenir avec la limite actuelle.

OCR

Le bloc OCR est responsable de la reconnaissance de texte dans les scans. La case à cocher dans l'en-tête du bloc active la reconnaissance, le champ Maximum pages per file limite le nombre de pages reconnues d'un fichier : de 1 à 500, par défaut 50.

Si l'OCR n'est pas déployé dans le projet, la case à cocher et le champ sont bloqués, et un avertissement est affiché dans le bloc.

Langue des documents et des requêtes

Le bloc Language of documents and queries détermine dans quelle langue les documents et les requêtes de recherche sont traités.

  • Document language detection — comment la langue du document est déterminée : automatiquement (par défaut) ou de manière fixe.
  • Default language — langue des documents : russian, english (par défaut), german, french ou simple.
  • Query language resolution — comment la langue de la requête de recherche est déterminée : automatiquement (par défaut), de manière fixe ou recherche dans toutes les langues présentes parmi les fichiers indexés.

Deux cases à cocher sont situées en dessous, par défaut les deux sont activées :

  • autorisation de corriger manuellement la langue d'un fichier individuel ;
  • recherche par partie de mot — un passage supplémentaire dans les documents trouvés, qui trouve des occurrences à l'intérieur d'un mot, mais ralentit considérablement la recherche.

Couverture de l'index

Le bloc Index coverage montre l'état de l'index :

  • combien de fichiers sont disponibles pour la recherche sur le nombre total ;
  • combien de fichiers attendent le service d'extraction de texte ;
  • combien de fichiers sont dans un format non pris en charge ;
  • combien de fichiers ont été traités avec une erreur ;
  • combien de fichiers ont été tronqués en raison de la limite de caractères ;
  • combien de fichiers ont été exclus manuellement de la recherche.

Chaque chiffre est un lien vers la liste des fichiers indexés avec un filtre déjà appliqué. Si un document n'est pas trouvé par la recherche, ces liens permettent de voir immédiatement la raison : format non pris en charge, extraction échouée ou texte tronqué.

Sous les compteurs, la taille de l'index et sa part du budget sont affichées, en mégaoctets et en pourcentages.

Réindexation

Pour retravailler les fichiers, sélectionnez dans la liste What to reindex, quels fichiers traiter :

  • uniquement ceux qui n'ont pas été traités (valeur par défaut) ;
  • uniquement ceux qui ont échoué ;
  • ceux qui sont tronqués et obsolètes ;
  • tous les fichiers.

Ensuite, cliquez sur Rebuild index. Après le lancement, un nombre de fichiers mis en file d'attente apparaîtra sous le bouton, et en cas d'échec, un message d'erreur sera affiché.

attention

Si le traitement du contenu des fichiers est désactivé dans le bloc Processing file contents, les tâches de réindexation seront mises en file d'attente, mais ne seront pas exécutées — le bloc avertit à ce sujet. Le bouton Rebuild index n'est disponible que pour les administrateurs ayant le droit de gérer l'index des fichiers.