Configurações de pesquisa de arquivos
As configurações são abertas pelo botão Settings na página de pesquisa. Aqui você define quais arquivos processar, quanto texto extrair deles e como determinar o idioma dos documentos e consultas. Também é possível ver qual parte dos arquivos já foi indexada e iniciar a reindexação.
Na página não há um botão geral "Salvar" — cada alteração é aplicada imediatamente após a entrada de um valor, seleção de uma lista ou alternância de uma caixa de seleção.
A página e o botão Settings estão disponíveis para administradores com permissão para gerenciar o índice de arquivos, e apenas aqueles que também têm permissão para alterar as configurações gerais podem modificar os valores; sem essa permissão, os campos estão disponíveis apenas para visualização. Mais detalhes estão na seção “Acesso à seção”.
Capacidades do projeto
O bloco Capacidades do projeto mostra o que está disponível para o projeto. Ele apenas informa — esses valores não podem ser alterados aqui. Cada linha é marcada com um ícone: ✓ — a capacidade está disponível, ✕ — não disponível.
- Feature included in tariff — a função está incluída na tarifa do projeto.
- Text extraction service available — a extração de texto de arquivos está disponível. Se não, a razão é indicada ao lado: o endereço do serviço não está definido, o serviço rejeitou a solicitação ou o serviço não responde.
- OCR available — o reconhecimento de digitalizações está disponível.
- Vector search available — a pesquisa vetorial está disponível.
Se a capacidade não estiver disponível, as configurações relacionadas abaixo permanecem visíveis, mas bloqueadas: por exemplo, sem a função na tarifa, não é possível ativar o processamento de arquivos, e sem OCR, não é possível configurar o reconhecimento.
Processamento do conteúdo dos arquivos
A caixa de seleção no cabeçalho do bloco Processamento do conteúdo dos arquivos ativa o processamento do conteúdo dos arquivos. Por padrão, o processamento está desativado. Desativar interrompe a extração de texto de novos arquivos, mas o índice já construído é mantido e ainda é possível pesquisar nele.
No bloco, você pode configurar:
- Formats for extraction — formatos de arquivos dos quais o texto é extraído:
txt,md,html,pdf,docx,odt,epub,rtf. Por padrão, todos estão selecionados. - Sections whose files are indexed — seções cujos arquivos são indexados: Products, Pages, Blocks, Slides, Templates, Discounts, Forms, Events, User Groups, Users, Admins.
- Maximum characters per file — quantos caracteres de texto são extraídos de um único arquivo: de
10000a2000000, por padrão500000. O texto além do limite não é incluído no índice, e o arquivo é considerado truncado. Abaixo do campo, é mostrado quantos arquivos aproximadamente cabem no volume permitido do índice com o limite atual.
As seções Users, User Groups e Admins contêm documentos de clientes e administradores. Se selecionadas, o bloco avisa: o texto desses arquivos se tornará acessível à pesquisa para todos que têm permissão para pesquisar e acessar a seção.
OCR (reconhecimento de digitalizações)
O bloco OCR (reconhecimento de digitalizações) é responsável pelo reconhecimento de texto em digitalizações. A caixa de seleção no cabeçalho do bloco ativa o reconhecimento, e o campo Maximum pages per file limita o número de páginas reconhecidas de um único arquivo: de 1 a 500, por padrão 50.
Se o reconhecimento não estiver disponível para o projeto, a caixa de seleção e o campo estão bloqueados, e um aviso é exibido no bloco. É possível reconhecer uma digitalização individual manualmente — na lista de arquivos indexados.
Idioma dos documentos e consultas
O bloco Idioma dos documentos e consultas determina em qual idioma os documentos e consultas de pesquisa são processados.
- Document language detection — como o idioma do documento é determinado: Automatic (por padrão) ou Fixed.
- Default language — idioma dos documentos:
russian,english(por padrão),german,frenchousimple. - Query language resolution — como o idioma da consulta de pesquisa é determinado: Automatic (por padrão), Fixed ou All corpus languages — pesquisa em todos os idiomas disponíveis entre os arquivos indexados.
Abaixo, há duas caixas de seleção, ambas ativadas por padrão:
- Allow manual file language override — permissão para corrigir manualmente o idioma de um arquivo individual;
- Search by part of a word — encontra ocorrências dentro de uma palavra, mas funciona significativamente mais devagar.
Cobertura do índice
O bloco Cobertura do índice mostra o estado do índice:
- quantos arquivos estão disponíveis para pesquisa do total;
- quantos arquivos estão aguardando o serviço de extração de texto;
- quantos arquivos estão em formato não suportado;
- quantos arquivos foram processados com erro;
- quantos arquivos foram truncados pelo limite de caracteres;
- quantos arquivos estão danificados;
- quantos arquivos foram excluídos da pesquisa manualmente;
- quantos arquivos contêm texto duvidoso — essa linha aparece apenas se houver tais arquivos.
Cada número é um link para a lista de arquivos indexados com o filtro já aplicado. Se um documento não for encontrado na pesquisa, você pode ver imediatamente o motivo por meio desses links: formato não suportado, extração falhou ou texto truncado.
Abaixo dos contadores, é mostrado o tamanho do índice em megabytes e sua proporção em relação ao volume permitido em porcentagem.
Se o volume permitido do índice for esgotado, o bloco avisa: novos documentos não são aceitos para processamento, e o índice já construído continua a ser pesquisado. A reindexação, nesse caso, não ajudará — é necessário liberar espaço ou aumentar o volume.
Se a extração for suspensa pelo operador da plataforma, o bloco também informa sobre isso. Essa pausa não é removida pela caixa de seleção Processing file contents; as tarefas agendadas não são perdidas e continuarão após a remoção da pausa.
Reindexação
Para reprocessar arquivos, selecione na lista What to reindex, quais arquivos processar:
- Only unprocessed — apenas não processados (valor padrão);
- Only failed — apenas os que falharam;
- Truncated and stale — truncados e obsoletos;
- Entire corpus — todos os arquivos.
Em seguida, clique em Rebuild index. Abaixo do botão, aparecerá uma barra de progresso da reindexação: primeiro, os arquivos são colocados na fila, depois é mostrado o percentual e o número de arquivos processados do total. Enquanto a reindexação estiver em andamento, o botão estará inativo. Se não houver arquivos na fatia selecionada, em vez da barra, será exibida a mensagem "Nothing to reindex". O resultado da última reindexação — percentual e número de arquivos processados do total — permanece abaixo do botão mesmo após sua conclusão.
Se o processamento do conteúdo dos arquivos estiver desativado no bloco Processing file contents, os arquivos entrarão na fila, mas não serão processados até que o processamento seja ativado. O botão Rebuild index está disponível apenas para administradores com permissão para gerenciar o índice de arquivos.