Pular para o conteúdo principal

Configurações de pesquisa de arquivos

As configurações são abertas pelo botão Settings na página de pesquisa. Aqui você define quais arquivos processar, quanto texto extrair deles e como determinar o idioma dos documentos e consultas. Também é possível ver qual parte dos arquivos já foi indexada e iniciar a reindexação.

info

Na página não há um botão geral "Salvar" — cada alteração é aplicada imediatamente após a entrada de um valor, seleção de uma lista ou alternância de uma caixa de seleção.

A página e o botão Settings estão disponíveis para administradores com permissão para gerenciar o índice de arquivos, e apenas aqueles que também têm permissão para alterar as configurações gerais podem modificar os valores; sem essa permissão, os campos estão disponíveis apenas para visualização. Mais detalhes estão na seção “Acesso à seção”.

Capacidades do projeto​

O bloco Capacidades do projeto mostra o que está disponível para o projeto. Ele apenas informa — esses valores não podem ser alterados aqui. Cada linha é marcada com um ícone: ✓ — a capacidade está disponível, ✕ — não disponível.

  • Feature included in tariff — a função está incluída na tarifa do projeto.
  • Text extraction service available — a extração de texto de arquivos está disponível. Se não, a razão é indicada ao lado: o endereço do serviço não está definido, o serviço rejeitou a solicitação ou o serviço não responde.
  • OCR available — o reconhecimento de digitalizações está disponível.
  • Vector search available — a pesquisa vetorial está disponível.

Se a capacidade não estiver disponível, as configurações relacionadas abaixo permanecem visíveis, mas bloqueadas: por exemplo, sem a função na tarifa, não é possível ativar o processamento de arquivos, e sem OCR, não é possível configurar o reconhecimento.

Processamento do conteúdo dos arquivos​

A caixa de seleção no cabeçalho do bloco Processamento do conteúdo dos arquivos ativa o processamento do conteúdo dos arquivos. Por padrão, o processamento está desativado. Desativar interrompe a extração de texto de novos arquivos, mas o índice já construído é mantido e ainda é possível pesquisar nele.

No bloco, você pode configurar:

  • Formats for extraction — formatos de arquivos dos quais o texto é extraído: txt, md, html, pdf, docx, odt, epub, rtf. Por padrão, todos estão selecionados.
  • Sections whose files are indexed — seções cujos arquivos são indexados: Products, Pages, Blocks, Slides, Templates, Discounts, Forms, Events, User Groups, Users, Admins.
  • Maximum characters per file — quantos caracteres de texto são extraídos de um único arquivo: de 10000 a 2000000, por padrão 500000. O texto além do limite não é incluído no índice, e o arquivo é considerado truncado. Abaixo do campo, é mostrado quantos arquivos aproximadamente cabem no volume permitido do índice com o limite atual.
Documentos pessoais

As seções Users, User Groups e Admins contêm documentos de clientes e administradores. Se selecionadas, o bloco avisa: o texto desses arquivos se tornará acessível à pesquisa para todos que têm permissão para pesquisar e acessar a seção.

OCR (reconhecimento de digitalizações)​

O bloco OCR (reconhecimento de digitalizações) é responsável pelo reconhecimento de texto em digitalizações. A caixa de seleção no cabeçalho do bloco ativa o reconhecimento, e o campo Maximum pages per file limita o número de páginas reconhecidas de um único arquivo: de 1 a 500, por padrão 50.

Se o reconhecimento não estiver disponível para o projeto, a caixa de seleção e o campo estão bloqueados, e um aviso é exibido no bloco. É possível reconhecer uma digitalização individual manualmente — na lista de arquivos indexados.

Idioma dos documentos e consultas​

O bloco Idioma dos documentos e consultas determina em qual idioma os documentos e consultas de pesquisa são processados.

  • Document language detection — como o idioma do documento é determinado: Automatic (por padrão) ou Fixed.
  • Default language — idioma dos documentos: russian, english (por padrão), german, french ou simple.
  • Query language resolution — como o idioma da consulta de pesquisa é determinado: Automatic (por padrão), Fixed ou All corpus languages — pesquisa em todos os idiomas disponíveis entre os arquivos indexados.

Abaixo, há duas caixas de seleção, ambas ativadas por padrão:

  • Allow manual file language override — permissão para corrigir manualmente o idioma de um arquivo individual;
  • Search by part of a word — encontra ocorrências dentro de uma palavra, mas funciona significativamente mais devagar.

Cobertura do índice​

O bloco Cobertura do índice mostra o estado do índice:

  • quantos arquivos estão disponíveis para pesquisa do total;
  • quantos arquivos estão aguardando o serviço de extração de texto;
  • quantos arquivos estão em formato não suportado;
  • quantos arquivos foram processados com erro;
  • quantos arquivos foram truncados pelo limite de caracteres;
  • quantos arquivos estão danificados;
  • quantos arquivos foram excluídos da pesquisa manualmente;
  • quantos arquivos contêm texto duvidoso — essa linha aparece apenas se houver tais arquivos.

Cada número é um link para a lista de arquivos indexados com o filtro já aplicado. Se um documento não for encontrado na pesquisa, você pode ver imediatamente o motivo por meio desses links: formato não suportado, extração falhou ou texto truncado.

Abaixo dos contadores, é mostrado o tamanho do índice em megabytes e sua proporção em relação ao volume permitido em porcentagem.

atenção

Se o volume permitido do índice for esgotado, o bloco avisa: novos documentos não são aceitos para processamento, e o índice já construído continua a ser pesquisado. A reindexação, nesse caso, não ajudará — é necessário liberar espaço ou aumentar o volume.

Se a extração for suspensa pelo operador da plataforma, o bloco também informa sobre isso. Essa pausa não é removida pela caixa de seleção Processing file contents; as tarefas agendadas não são perdidas e continuarão após a remoção da pausa.

Reindexação​

Para reprocessar arquivos, selecione na lista What to reindex, quais arquivos processar:

  • Only unprocessed — apenas não processados (valor padrão);
  • Only failed — apenas os que falharam;
  • Truncated and stale — truncados e obsoletos;
  • Entire corpus — todos os arquivos.

Em seguida, clique em Rebuild index. Abaixo do botão, aparecerá uma barra de progresso da reindexação: primeiro, os arquivos são colocados na fila, depois é mostrado o percentual e o número de arquivos processados do total. Enquanto a reindexação estiver em andamento, o botão estará inativo. Se não houver arquivos na fatia selecionada, em vez da barra, será exibida a mensagem "Nothing to reindex". O resultado da última reindexação — percentual e número de arquivos processados do total — permanece abaixo do botão mesmo após sua conclusão.

atenção

Se o processamento do conteúdo dos arquivos estiver desativado no bloco Processing file contents, os arquivos entrarão na fila, mas não serão processados até que o processamento seja ativado. O botão Rebuild index está disponível apenas para administradores com permissão para gerenciar o índice de arquivos.