Pesquisa de conteúdo de arquivos
A aba File Search na seção Settings gerencia a busca por texto em arquivos carregados no projeto: quais arquivos processar, quanto texto extrair deles, como determinar o idioma dos documentos e das consultas. Aqui também é possível ver qual parte dos arquivos já foi indexada e iniciar a reindexação.
Na aba não há um botão geral "Salvar" — cada alteração é aplicada imediatamente após a entrada de um valor, seleção de uma lista ou alternância de uma caixa de seleção. Ajustes nas configurações podem ser feitos apenas por administradores com permissão para alterar as configurações gerais; sem essa permissão, os campos estão disponíveis apenas para visualização.
Capacidades do projeto
O bloco Project capabilities mostra o que está disponível para o projeto. Ele apenas informa — esses valores não podem ser alterados na aba. Cada linha é marcada com um ícone: ✓ — a capacidade está disponível, ✕ — não disponível (com explicação do motivo).
- A função está incluída no plano do projeto.
- O serviço de extração de texto de arquivos está disponível.
- O reconhecimento de digitalizações (OCR) está disponível.
- A busca vetorial está disponível.
Se a capacidade não estiver disponível, as configurações relacionadas abaixo permanecem visíveis, mas bloqueadas: por exemplo, sem a função no plano, não é possível ativar o processamento de arquivos, e sem OCR, não é possível configurar o reconhecimento.
Processamento do conteúdo dos arquivos
A caixa de seleção no cabeçalho do bloco Processing file contents ativa o processamento do conteúdo dos arquivos. Desativá-la interrompe a extração de texto de novos arquivos, mas o índice já construído é mantido e ainda é possível buscar por ele.
No bloco, são configurados:
- Formats for extraction — formatos de arquivos dos quais o texto é extraído:
txt,md,html,pdf,docx,odt,epub,rtf. Por padrão, todos estão selecionados. - Sections whose files are indexed — seções cujos arquivos são indexados: Products, Pages, Blocks, Slides, Templates, Discounts. Por padrão, todas estão selecionadas.
- Maximum characters per file — quantos caracteres de texto são extraídos de um único arquivo: de
10000a2000000, por padrão500000. O texto que exceder o limite não entra no índice, e o arquivo é considerado truncado. Abaixo do campo, é mostrado aproximadamente quantos arquivos cabem no orçamento do índice com o limite atual.
OCR
O bloco OCR é responsável pelo reconhecimento de texto em digitalizações. A caixa de seleção no cabeçalho do bloco ativa o reconhecimento, e o campo Maximum pages per file limita o número de páginas reconhecidas de um único arquivo: de 1 a 500, por padrão 50.
Se o OCR não estiver ativado no projeto, a caixa de seleção e o campo estarão bloqueados, e uma mensagem de aviso será exibida no bloco.
Idioma dos documentos e consultas
O bloco Language of documents and queries determina em qual idioma os documentos e as consultas de busca são processados.
- Document language detection — como o idioma do documento é determinado: automaticamente (por padrão) ou fixamente.
- Default language — idioma dos documentos:
russian,english(por padrão),german,frenchousimple. - Query language resolution — como o idioma da consulta de busca é determinado: automaticamente (por padrão), fixamente ou busca em todos os idiomas disponíveis entre os arquivos indexados.
Abaixo, há duas caixas de seleção, ambas ativadas por padrão:
- permissão para corrigir manualmente o idioma de um arquivo específico;
- busca por parte da palavra — uma passagem adicional pelos documentos encontrados, que encontra ocorrências dentro da palavra, mas desacelera significativamente a busca.
Cobertura do índice
O bloco Index coverage mostra o estado do índice:
- quantos arquivos estão disponíveis para busca do total;
- quantos arquivos estão aguardando o serviço de extração de texto;
- quantos arquivos estão em formato não suportado;
- quantos arquivos foram processados com erro;
- quantos arquivos foram truncados pelo limite de caracteres;
- quantos arquivos foram excluídos da busca manualmente.
Cada número é um link para a lista de arquivos indexados com o filtro já aplicado. Se um documento não for encontrado na busca, é possível ver imediatamente, por meio desses links, qual é a razão: formato não suportado, extração falhou ou texto truncado.
Abaixo dos contadores, é mostrado o tamanho do índice e sua proporção em relação ao orçamento, em megabytes e porcentagens.
Reindexação
Para reprocessar arquivos, selecione na lista What to reindex quais arquivos processar:
- apenas os não processados (valor padrão);
- apenas os que falharam;
- truncados e obsoletos;
- todos os arquivos.
Em seguida, clique em Rebuild index. Após o início, aparecerá o número de arquivos na fila abaixo do botão, e em caso de falha, uma mensagem de erro.
Se o processamento do conteúdo dos arquivos estiver desativado no bloco Processing file contents, as tarefas de reindexação ficarão na fila, mas não serão executadas — o bloco avisa sobre isso. O botão Rebuild index está disponível apenas para administradores com permissão para gerenciar o índice de arquivos.