Como ocultar texto sensível num PDF
Forneça um PDF válido em base64, indique texto pesquisável não vazio e use o PDF devolvido para confirmar as redações aplicadas.
Quando usar a redação de texto
Este processo serve para retirar correspondências de texto num PDF quando a informação está disponível como texto pesquisável. A entrada combina o conteúdo do ficheiro em base64 com uma expressão de pesquisa, e as regiões encontradas são submetidas a redação. O resultado bem-sucedido é outro PDF em base64, acompanhado por dados sobre o processamento. Esta abordagem é adequada para nomes, números ou expressões que consiga localizar pela respectiva forma escrita no documento.
Antes de começar, confirme que dispõe do PDF original e que sabe qual a sequência que pretende procurar. A conversão para base64 não altera o documento por si só, mas a cadeia resultante tem de representar bytes cujo início corresponde à assinatura de um PDF. Também convém decidir se quer indicar uma substituição de texto ASCII ou deixar a opção de substituição por omissão.
Passos para preparar e processar o PDF
-
Abra o PDF que pretende tratar e converta os respectivos bytes para uma cadeia base64. Verifique se a descodificação dessa cadeia produz um PDF válido; um valor que não comece pela assinatura de PDF não passa a ser válido apenas por estar codificado em base64.
-
Escreva no campo de pesquisa o texto que deve ser ocultado. A pesquisa tem de conter pelo menos um carácter: uma cadeia vazia faz a operação falhar antes de o documento ser processado. Escolha a grafia, a pontuação e os espaços com base no texto que aparece nas páginas do ficheiro.
-
Se quiser definir o conteúdo de substituição, forneça uma sequência ASCII. O valor predefinido é representado por um carácter de bloco, mas esse carácter não ASCII não é fornecido como texto de substituição da anotação PDF. Por isso, não trate a opção por omissão como se tivesse inserido literalmente esse símbolo no PDF.
-
Forneça a cadeia base64, o texto de pesquisa e, quando aplicável, a substituição ASCII. A ausência do ficheiro provoca uma falha, tal como uma entrada que não descodifique para bytes com a assinatura de PDF.
-
Quando a operação terminar com sucesso, conserve o PDF devolvido em base64 e descodifique-o para obter o documento processado. Consulte os dois contadores do resultado: um indica o número de páginas processadas e o outro indica quantas ocorrências foram encontradas.
-
Abra o documento obtido e confirme o conteúdo que pretendia retirar antes de o utilizar. Se alterou a expressão de pesquisa entre tentativas, registe qual foi a cadeia usada para poder comparar o contador de ocorrências com o resultado visual.
O que significam os dados devolvidos
Um resultado bem-sucedido contém um PDF processado em base64, no qual o conteúdo correspondente às correspondências foi removido através de redações aplicadas. O contador de páginas descreve a extensão do processamento, enquanto o contador de ocorrências ajuda a perceber se a expressão indicada foi localizada.
Um valor de ocorrências igual a zero não prova que a informação não existe no documento. Compare a expressão usada com a grafia visível, os espaços e a forma como o texto foi dividido na página. A pesquisa incide no texto das páginas do PDF; não abrange texto que exista apenas numa imagem nem conteúdo cuja leitura dependa de OCR.
A confirmação deve ser feita no PDF descodificado, e não apenas na cadeia base64. Se o documento não apresentar o resultado esperado, reveja a entrada, a expressão e a forma como o texto está armazenado antes de repetir o processamento.
Exemplo prático
Uma pessoa precisa de ocultar um número de identificação apresentado como texto pesquisável num PDF antes de partilhar o documento.
Uma pessoa converte para base64 um PDF pesquisável que contém um número de identificação, usa esse número como texto de pesquisa e fornece uma substituição ASCII. Depois, descodifica o resultado e verifica os contadores e a remoção da correspondência.
O resultado apresenta um PDF processado em base64, o número de páginas processadas e o número de ocorrências encontradas; a correspondência deixa de estar presente no PDF devolvido.
Limitações
- A pesquisa não inclui texto incorporado apenas em imagens nem conteúdo que exija OCR para ser lido.
Erros comuns
- Pesquisa vazia ou entrada inválida: a operação falha antes de tratar o PDF quando não existe texto de pesquisa, quando falta o ficheiro ou quando a descodificação não começa pela assinatura de PDF. Indique uma expressão não vazia e valide a cadeia base64 antes de tentar novamente.
Perguntas frequentes
Que tipo de texto pode ser ocultado?
A ferramenta pesquisa o texto disponível nas páginas do PDF e aplica redações nas regiões que correspondem à expressão indicada. Texto presente somente numa imagem fica fora desse tipo de pesquisa.
Posso ocultar texto sem indicar uma expressão de pesquisa?
Não, quando a expressão está vazia: essa condição faz a operação falhar antes do processamento. Indique pelo menos um carácter no texto de pesquisa para prosseguir.
O que recebo depois do processamento?
Depois de um processamento bem-sucedido, o resultado inclui um PDF em base64 com as correspondências removidas através de redações aplicadas. Também são apresentados o número de páginas processadas e a quantidade de ocorrências encontradas.