Saltar al contenido principal

Búsqueda en el contenido de archivos

La pestaña File Search en la sección Settings gestiona la búsqueda de texto en los archivos cargados en el proyecto: qué archivos procesar, cuántos textos extraer de ellos, cómo determinar el idioma de los documentos y las consultas. Aquí también se puede ver qué parte de los archivos ya ha sido indexada y se puede iniciar la reindexación.

info

En la pestaña no hay un botón general de "Guardar" — cada cambio se aplica inmediatamente después de ingresar un valor, seleccionar de la lista o alternar una casilla de verificación. Los parámetros pueden ser modificados por administradores con derecho a cambiar la configuración general; sin este derecho, los campos están disponibles solo para visualización.

Capacidades del proyecto

El bloque Project capabilities muestra lo que está disponible para el proyecto. Solo informa — no se pueden cambiar estos valores en la pestaña. Cada línea está marcada con un ícono: ✓ — la capacidad está disponible, ✕ — no está disponible (con una explicación del motivo).

  • Si la función está incluida en la tarifa del proyecto.
  • Si el servicio de extracción de texto de archivos está disponible.
  • Si el reconocimiento de escaneos (OCR) está disponible.
  • Si la búsqueda vectorial está disponible.

Si una capacidad no está disponible, las configuraciones relacionadas a continuación permanecen visibles, pero bloqueadas: por ejemplo, sin la función en la tarifa no se puede habilitar el procesamiento de archivos, y sin OCR no se puede configurar el reconocimiento.

Procesamiento del contenido de archivos

La casilla de verificación en el encabezado del bloque Processing file contents activa el procesamiento del contenido de los archivos. Desactivarlo detiene la extracción de texto de nuevos archivos, pero el índice ya construido se conserva y aún se puede buscar en él.

En el bloque se configuran:

  • Formats for extraction — formatos de archivos de los cuales se extrae texto: txt, md, html, pdf, docx, odt, epub, rtf. Por defecto, todos están seleccionados.
  • Sections whose files are indexed — secciones cuyos archivos se indexan: Products, Pages, Blocks, Slides, Templates, Discounts. Por defecto, todas están seleccionadas.
  • Maximum characters per file — cuántos caracteres de texto se extraen de un solo archivo: de 10000 a 2000000, por defecto 500000. El texto que exceda el límite no se incluye en el índice, y el archivo se considera truncado. Debajo del campo se muestra cuántos archivos aproximadamente puede contener el presupuesto del índice con el límite actual.

OCR

El bloque OCR se encarga del reconocimiento de texto en escaneos. La casilla de verificación en el encabezado del bloque activa el reconocimiento, y el campo Maximum pages per file limita el número de páginas reconocibles de un archivo: de 1 a 500, por defecto 50.

Si OCR no está desplegado en el proyecto, la casilla de verificación y el campo están bloqueados, y se muestra una advertencia en el bloque.

Idioma de documentos y consultas

El bloque Language of documents and queries determina en qué idioma se procesan los documentos y las consultas de búsqueda.

  • Document language detection — cómo se determina el idioma del documento: automáticamente (por defecto) o de forma fija.
  • Default language — idioma de los documentos: russian, english (por defecto), german, french o simple.
  • Query language resolution — cómo se determina el idioma de la consulta de búsqueda: automáticamente (por defecto), de forma fija o búsqueda en todos los idiomas que existen entre los archivos indexados.

A continuación, hay dos casillas de verificación, ambas activadas por defecto:

  • permitir corregir manualmente el idioma de un archivo individual;
  • búsqueda por parte de la palabra — un paso adicional a través de los documentos encontrados, que encuentra ocurrencias dentro de la palabra, pero ralentiza notablemente la búsqueda.

Cobertura del índice

El bloque Index coverage muestra el estado del índice:

  • cuántos archivos están disponibles para búsqueda del total;
  • cuántos archivos están esperando el servicio de extracción de texto;
  • cuántos archivos están en un formato no soportado;
  • cuántos archivos se han procesado con error;
  • cuántos archivos han sido truncados por el límite de caracteres;
  • cuántos archivos han sido excluidos manualmente de la búsqueda.

Cada número es un enlace a la lista de archivos indexados con el filtro ya aplicado. Si un documento no se encuentra en la búsqueda, a través de estos enlaces se puede ver de inmediato cuál es la razón: el formato no es compatible, la extracción terminó con error o el texto fue truncado.

Debajo de los contadores se muestra el tamaño del índice y su proporción del presupuesto, en megabytes y porcentajes.

Reindexación

Para volver a procesar archivos, seleccione en la lista What to reindex, qué archivos procesar:

  • solo los no procesados (valor por defecto);
  • solo los que terminaron con error;
  • truncados y obsoletos;
  • todos los archivos.

Luego haga clic en Rebuild index. Después de iniciar, aparecerá el número de archivos en cola debajo del botón, y en caso de error, un mensaje de error.

advertencia

Si el procesamiento del contenido de archivos está desactivado en el bloque Processing file contents, las tareas de reindexación se pondrán en cola, pero no se ejecutarán, — el bloque advierte sobre esto. El botón Rebuild index solo está disponible para administradores con derecho a gestionar el índice de archivos.