Búsqueda en el contenido de archivos
La pestaña File Search en la sección Settings gestiona la búsqueda de texto en los archivos cargados en el proyecto: qué archivos procesar, cuántos textos extraer de ellos, cómo determinar el idioma de los documentos y las consultas. Aquí también se puede ver qué parte de los archivos ya ha sido indexada y se puede iniciar la reindexación.
En la pestaña no hay un botón general de "Guardar" — cada cambio se aplica inmediatamente después de ingresar un valor, seleccionar de la lista o alternar una casilla de verificación. Los parámetros pueden ser modificados por administradores con derecho a cambiar la configuración general; sin este derecho, los campos están disponibles solo para visualización.
Capacidades del proyecto
El bloque Project capabilities muestra lo que está disponible para el proyecto. Solo informa — no se pueden cambiar estos valores en la pestaña. Cada línea está marcada con un ícono: ✓ — la capacidad está disponible, ✕ — no está disponible (con una explicación del motivo).
- Si la función está incluida en la tarifa del proyecto.
- Si el servicio de extracción de texto de archivos está disponible.
- Si el reconocimiento de escaneos (OCR) está disponible.
- Si la búsqueda vectorial está disponible.
Si una capacidad no está disponible, las configuraciones relacionadas a continuación permanecen visibles, pero bloqueadas: por ejemplo, sin la función en la tarifa no se puede habilitar el procesamiento de archivos, y sin OCR no se puede configurar el reconocimiento.
Procesamiento del contenido de archivos
La casilla de verificación en el encabezado del bloque Processing file contents activa el procesamiento del contenido de los archivos. Desactivarlo detiene la extracción de texto de nuevos archivos, pero el índice ya construido se conserva y aún se puede buscar en él.
En el bloque se configuran:
- Formats for extraction — formatos de archivos de los cuales se extrae texto:
txt,md,html,pdf,docx,odt,epub,rtf. Por defecto, todos están seleccionados. - Sections whose files are indexed — secciones cuyos archivos se indexan: Products, Pages, Blocks, Slides, Templates, Discounts. Por defecto, todas están seleccionadas.
- Maximum characters per file — cuántos caracteres de texto se extraen de un solo archivo: de
10000a2000000, por defecto500000. El texto que exceda el límite no se incluye en el índice, y el archivo se considera truncado. Debajo del campo se muestra cuántos archivos aproximadamente puede contener el presupuesto del índice con el límite actual.
OCR
El bloque OCR se encarga del reconocimiento de texto en escaneos. La casilla de verificación en el encabezado del bloque activa el reconocimiento, y el campo Maximum pages per file limita el número de páginas reconocibles de un archivo: de 1 a 500, por defecto 50.
Si OCR no está desplegado en el proyecto, la casilla de verificación y el campo están bloqueados, y se muestra una advertencia en el bloque.