Saltar al contenido principal

Configuración de búsqueda de archivos

La configuración se abre con el botón Settings en la página de búsqueda. Aquí se determina qué archivos procesar, cuánta información extraer de ellos y cómo identificar el idioma de los documentos y las consultas. También se puede ver qué parte de los archivos ya ha sido indexada y se puede iniciar la reindexación.

info

En la página no hay un botón general de "Guardar": cada cambio se aplica inmediatamente después de ingresar un valor, seleccionar de la lista o alternar una casilla de verificación.

La página y el botón Settings están disponibles para administradores con derecho a gestionar el índice de archivos, y solo puede cambiar los valores quien también tenga derecho a modificar la configuración general; sin este derecho, los campos son solo de lectura. Más detalles en la sección “Acceso a la sección”.

Capacidades del proyecto​

El bloque Capacidades del proyecto muestra lo que está disponible para el proyecto. Solo informa: no se pueden cambiar estos valores aquí. Cada línea está marcada con un ícono: ✓ — la función está disponible, ✕ — no está disponible.

  • Feature included in tariff — si la función está incluida en la tarifa del proyecto.
  • Text extraction service available — si está disponible la extracción de texto de los archivos. Si no, se indica la razón: la dirección del servicio no está especificada, el servicio rechazó la solicitud o el servicio no responde.
  • OCR available — si está disponible el reconocimiento de escaneos.
  • Vector search available — si está disponible la búsqueda vectorial.

Si una función no está disponible, las configuraciones relacionadas permanecen visibles, pero bloqueadas: por ejemplo, sin la función en la tarifa no se puede habilitar el procesamiento de archivos, y sin OCR no se puede configurar el reconocimiento.

Procesamiento del contenido de archivos​

La casilla de verificación en el encabezado del bloque Procesamiento del contenido de archivos habilita el procesamiento del contenido de los archivos. Por defecto, el procesamiento está desactivado. Desactivarlo detiene la extracción de texto de nuevos archivos, pero el índice ya construido se conserva y aún se puede buscar en él.

En el bloque se configuran:

  • Formats for extraction — formatos de archivos de los que se extrae texto: txt, md, html, pdf, docx, odt, epub, rtf. Por defecto, se seleccionan todos.
  • Sections whose files are indexed — secciones cuyos archivos se indexan: Products, Pages, Blocks, Slides, Templates, Discounts, Forms, Events, User Groups, Users, Admins.
  • Maximum characters per file — cuántos caracteres de texto se extraen de un archivo: de 10000 a 2000000, por defecto 500000. El texto que exceda el límite no se incluye en el índice, y el archivo se considera truncado. Debajo del campo se muestra cuántos archivos aproximadamente caben en el volumen permitido del índice con el límite actual.
Documentos personales

Las secciones Users, User Groups y Admins contienen documentos de clientes y administradores. Si se seleccionan, el bloque advierte: el texto de estos archivos estará disponible para la búsqueda para todos los que tengan derecho a buscar y acceder a la sección.

OCR (reconocimiento de escaneos)​

El bloque OCR (reconocimiento de escaneos) se encarga del reconocimiento de texto en escaneos. La casilla de verificación en el encabezado del bloque habilita el reconocimiento, y el campo Maximum pages per file limita el número de páginas reconocibles de un archivo: de 1 a 500, por defecto 50.

Si el reconocimiento no está disponible para el proyecto, la casilla de verificación y el campo están bloqueados, y se muestra una advertencia en el bloque. Se puede reconocer un escaneo individual manualmente en la lista de archivos indexados.

Idioma de documentos y consultas​

El bloque Idioma de documentos y consultas determina en qué idioma se procesan los documentos y las consultas de búsqueda.

  • Document language detection — cómo se determina el idioma del documento: Automatic (por defecto) o Fixed.
  • Default language — idioma de los documentos: russian, english (por defecto), german, french o simple.
  • Query language resolution — cómo se determina el idioma de la consulta de búsqueda: Automatic (por defecto), Fixed o All corpus languages — búsqueda en todos los idiomas que existen entre los archivos indexados.

Debajo hay dos casillas de verificación, ambas habilitadas por defecto:

  • Allow manual file language override — permiso para corregir manualmente el idioma de un archivo individual;
  • Search by part of a word — encuentra coincidencias dentro de una palabra, pero funciona notablemente más lento.

Cobertura del índice​

El bloque Cobertura del índice muestra el estado del índice:

  • cuántos archivos están disponibles para búsqueda del total;
  • cuántos archivos están esperando el servicio de extracción de texto;
  • cuántos archivos están en un formato no soportado;
  • cuántos archivos se procesaron con error;
  • cuántos archivos fueron truncados por el límite de caracteres;
  • cuántos archivos están dañados;
  • cuántos archivos fueron excluidos manualmente de la búsqueda;
  • cuántos archivos tienen texto dudoso — esta línea aparece solo si hay tales archivos.

Cada número es un enlace a la lista de archivos indexados con el filtro ya aplicado. Si un documento no se encuentra en la búsqueda, a través de estos enlaces se puede ver inmediatamente la razón: el formato no es compatible, la extracción terminó con error o el texto fue truncado.

Debajo de los contadores se muestra el tamaño del índice en megabytes y su proporción del volumen permitido en porcentaje.

advertencia

Si el volumen permitido del índice se ha agotado, el bloque advierte: nuevos documentos no se aceptan para procesamiento, y el índice ya construido sigue siendo buscable. La reindexación en este caso no ayudará: es necesario liberar espacio o aumentar el volumen.

Si la extracción ha sido suspendida por el operador de la plataforma, el bloque también informa sobre esto. Esta pausa no se elimina con la casilla de verificación Processing file contents; las tareas en cola no se pierden y continuarán después de que se levante la pausa.

Reindexación​

Para volver a procesar los archivos, seleccione en la lista What to reindex, qué archivos procesar:

  • Only unprocessed — solo los no procesados (valor por defecto);
  • Only failed — solo los que terminaron con error;
  • Truncated and stale — truncados y obsoletos;
  • Entire corpus — todos los archivos.

Luego haga clic en Rebuild index. Debajo del botón aparecerá una barra de progreso de reindexación: primero los archivos se ponen en cola, luego se muestra el porcentaje y el número de archivos procesados del total. Mientras la reindexación esté en curso, el botón estará inactivo. Si no hay archivos en el corte seleccionado, en lugar de la barra se mostrará el mensaje "Nothing to reindex". El resultado de la última reindexación — porcentaje y número de archivos procesados del total — permanece debajo del botón incluso después de que se complete.

advertencia

Si el procesamiento del contenido de los archivos está desactivado en el bloque Processing file contents, los archivos se pondrán en cola, pero no se procesarán hasta que se habilite el procesamiento. El botón Rebuild index solo está disponible para administradores con derecho a gestionar el índice de archivos.