Paramètres de recherche de fichiers
Les paramètres s'ouvrent avec le bouton Settings sur la page de recherche. Ici, vous définissez quels fichiers traiter, combien de texte en extraire et comment déterminer la langue des documents et des requêtes. Vous pouvez également voir quelle partie des fichiers a déjà été indexée et lancer une réindexation.
Il n'y a pas de bouton « Enregistrer » général sur la page — chaque modification est appliquée immédiatement après la saisie d'une valeur, la sélection dans une liste ou le basculement d'une case à cocher.
La page et le bouton Settings sont accessibles aux administrateurs ayant le droit de gérer l'index des fichiers, et seules les personnes ayant également le droit de modifier les paramètres généraux peuvent changer les valeurs ; sans cela, les champs sont uniquement en mode consultation. Pour plus de détails, voir la section « Accès à la section ».
Capacités du projet
Le bloc Project capabilities montre ce qui est disponible pour le projet. Il sert uniquement à informer — ces valeurs ne peuvent pas être modifiées ici. Chaque ligne est marquée par une icône : ✓ — possibilité disponible, ✕ — non disponible.
- Feature included in tariff — la fonction est-elle incluse dans le tarif du projet.
- Text extraction service available — l'extraction de texte à partir des fichiers est-elle disponible. Si ce n'est pas le cas, la raison est indiquée à côté : l'adresse du service n'est pas définie, le service a rejeté la demande ou le service ne répond pas.
- OCR available — la reconnaissance des scans est-elle disponible.
- Vector search available — la recherche vectorielle est-elle disponible.
Si une possibilité n'est pas disponible, les paramètres associés ci-dessous restent visibles, mais sont bloqués : par exemple, sans fonction dans le tarif, il n'est pas possible d'activer le traitement des fichiers, et sans OCR, il n'est pas possible de configurer la reconnaissance.
Traitement du contenu des fichiers
La case à cocher dans l'en-tête du bloc Processing file contents active le traitement du contenu des fichiers. Par défaut, le traitement est désactivé. La désactivation arrête l'extraction de texte à partir de nouveaux fichiers, mais l'index déjà construit est conservé et il est toujours possible de rechercher à partir de celui-ci.
Dans le bloc, vous pouvez configurer :
- Formats for extraction — formats de fichiers à partir desquels le texte est extrait :
txt,md,html,pdf,docx,odt,epub,rtf. Par défaut, tous sont sélectionnés. - Sections whose files are indexed — sections dont les fichiers sont indexés : Products, Pages, Blocks, Slides, Templates, Discounts, Forms, Events, User Groups, Users, Admins.
- Maximum characters per file — combien de caractères de texte sont extraits d'un fichier : de
10000à2000000, par défaut500000. Le texte au-delà de la limite n'est pas inclus dans l'index, et le fichier est considéré comme tronqué. Sous le champ, il est indiqué combien de fichiers peuvent être contenus dans le volume d'index autorisé avec la limite actuelle.
Les sections Users, User Groups et Admins contiennent des documents de clients et d'administrateurs. Si elles sont sélectionnées, le bloc avertit : le texte de ces fichiers sera accessible à la recherche pour tous ceux qui ont le droit de rechercher et d'accéder à la section.
OCR (reconnaissance de scans)
Le bloc OCR (scan recognition) est responsable de la reconnaissance de texte dans les scans. La case à cocher dans l'en-tête du bloc active la reconnaissance, le champ Maximum pages per file limite le nombre de pages reconnues d'un fichier : de 1 à 500, par défaut 50.
Si la reconnaissance n'est pas disponible pour le projet, la case à cocher et le champ sont bloqués, et un avertissement est affiché dans le bloc. Il est également possible de reconnaître un scan individuel manuellement — dans la liste des fichiers indexés.
Langue des documents et des requêtes
Le bloc Language of documents and queries détermine dans quelle langue les documents et les requêtes de recherche sont traités.
- Document language detection — comment la langue du document est-elle déterminée : Automatic (par défaut) ou Fixed.
- Default language — langue des documents :
russian,english(par défaut),german,frenchousimple. - Query language resolution — comment la langue de la requête de recherche est-elle déterminée : Automatic (par défaut), Fixed ou All corpus languages — recherche dans toutes les langues présentes parmi les fichiers indexés.
Deux cases à cocher sont situées en dessous, par défaut les deux sont activées :
- Allow manual file language override — autorisation de corriger manuellement la langue d'un fichier individuel ;
- Search by part of a word — trouve des occurrences à l'intérieur d'un mot, mais fonctionne de manière significativement plus lente.
Couverture de l'index
Le bloc Index coverage montre l'état de l'index :
- combien de fichiers sont disponibles pour la recherche sur le nombre total ;
- combien de fichiers attendent le service d'extraction de texte ;
- combien de fichiers sont dans un format non pris en charge ;
- combien de fichiers ont été traités avec une erreur ;
- combien de fichiers ont été tronqués en raison de la limite de caractères ;
- combien de fichiers sont endommagés ;
- combien de fichiers ont été exclus de la recherche manuellement ;
- combien de fichiers contiennent un texte douteux — cette ligne apparaît uniquement s'il y a de tels fichiers.
Chaque chiffre est un lien vers la liste des fichiers indexés avec un filtre déjà appliqué. Si un document ne se trouve pas par la recherche, vous pouvez immédiatement voir la raison via ces liens : le format n'est pas pris en charge, l'extraction a échoué ou le texte a été tronqué.
Sous les compteurs, la taille de l'index en mégaoctets et sa part du volume autorisé en pourcentage sont affichées.
Si le volume autorisé de l'index est épuisé, le bloc avertit : de nouveaux documents ne sont pas acceptés pour traitement, et l'index déjà construit continue d'être recherché. La réindexation dans ce cas ne sera pas utile — il faut libérer de l'espace ou augmenter le volume.
Si l'extraction est suspendue par l'opérateur de la plateforme, le bloc en informe également. Une telle pause n'est pas levée par la case à cocher Processing file contents ; les tâches en cours ne sont pas perdues et reprendront après la levée de la pause.
Réindexation
Pour retravailler les fichiers, sélectionnez dans la liste What to reindex, quels fichiers traiter :
- Only unprocessed — uniquement les non traités (valeur par défaut) ;
- Only failed — uniquement ceux ayant échoué ;
- Truncated and stale — tronqués et obsolètes ;
- Entire corpus — tous les fichiers.
Ensuite, cliquez sur Rebuild index. Une barre de progression de la réindexation apparaîtra sous le bouton : d'abord, les fichiers sont mis en file d'attente, puis le pourcentage et le nombre de fichiers traités sur le total sont affichés. Tant que la réindexation est en cours, le bouton est inactif. Si aucun fichier n'est présent dans la tranche sélectionnée, un message « Nothing to reindex » s'affiche à la place de la barre. Le résultat de la dernière réindexation — le pourcentage et le nombre de fichiers traités sur le total — reste sous le bouton même après son achèvement.
Si le traitement du contenu des fichiers est désactivé dans le bloc Processing file contents, les fichiers seront mis en file d'attente, mais ne seront pas traités tant que le traitement n'est pas activé. Le bouton Rebuild index est uniquement accessible aux administrateurs ayant le droit de gérer l'index des fichiers.