Como extrair texto de um PDF por página
Forneça um PDF com dados e escolha entre abranger todas as páginas ou indicar páginas inteiras específicas. O resultado reúne o texto selecionado, os marcadores de página e as contagens do documento e da seleção inicial.
Para que serve a extração de texto
O PDF to Text extrai o conteúdo textual de um ficheiro PDF e permite concentrar a operação em páginas determinadas. É uma opção prática quando pretende consultar o texto de um documento sem percorrer todas as páginas. A seleção pode abranger o PDF inteiro ou limitar-se a referências escolhidas, conforme o objetivo da leitura. Antes de começar, tenha preparado um PDF com dados e decida se necessita do documento completo ou apenas de alguns trechos.
A ferramenta não transforma o conteúdo numa nova estrutura de documento: o resultado reúne o texto extraído das páginas selecionadas num resultado maior. Essa organização é útil para localizar a passagem correspondente a cada página e para comparar a quantidade pedida com a quantidade efetivamente considerada. A preparação da entrada e a escolha correta das páginas são, por isso, os dois pontos principais desta utilização. Ao trabalhar com um documento extenso, uma seleção reduzida pode tornar a revisão mais focada, sem alterar a regra de numeração usada pela operação.
Como extrair texto de um PDF
-
Prepare o ficheiro PDF que pretende analisar e forneça-o como entrada. A ferramenta recebe uma cadeia que contém dados PDF codificados; uma entrada vazia faz a operação falhar, pelo que deve confirmar que os dados estão presentes antes de começar.
-
Para abranger todas as páginas, deixe a seleção específica por definir. Essa é a opção predefinida e faz com que a operação considere as páginas disponíveis no documento.
-
Para escolher apenas algumas páginas, introduza números inteiros separados por vírgulas, como
1,3,5. A numeração é baseada em um, portanto1corresponde à primeira página; não use texto que não possa ser convertido num número inteiro, porque essa conversão pode provocar uma falha. -
Inicie a operação depois de confirmar a entrada e a seleção. Para cada página incluída, o texto extraído é colocado num resultado maior, com um marcador antes do conteúdo dessa página.
-
Verifique o resultado e leia as informações de contexto apresentadas. O total de páginas descreve a dimensão do documento, enquanto o número de páginas selecionadas indica quantas referências foram consideradas. Se uma referência estiver fora do intervalo existente, é ignorada. Se a análise do PDF ou a extração encontrar um erro, a operação falha e apresenta a mensagem resultante.
Como ler o resultado
Num resultado bem-sucedido, procure o texto das páginas incluídas e o marcador que assinala o início de cada bloco. O marcador permite associar um excerto à página de origem quando foram selecionadas várias páginas, enquanto as duas contagens ajudam a confirmar o alcance da operação. Se não tiver indicado páginas, a contagem selecionada relaciona-se com a seleção predefinida do documento.
Uma lista pode conter referências que não correspondem a páginas existentes. Nessa situação, essas referências não produzem texto e são retiradas da consideração da operação, por isso a quantidade selecionada pode ser inferior ao número de itens introduzidos. Compare sempre a contagem apresentada com a seleção que pretendia fazer, em vez de concluir apenas pela lista escrita.
Se a operação falhar, a mensagem apresentada indica que não existe um resultado concluído para interpretar. Um problema de análise, de extração ou a indisponibilidade do suporte necessário para interpretar o PDF impede a conclusão. Um resultado sem texto também deve ser lido com cautela: a capacidade de extrair conteúdo textual depende do documento e do processamento disponível.
Exemplo prático
Precisa de rever apenas a segunda página de um relatório PDF e introduz o número 2 antes de iniciar a extração, procurando depois o texto associado a essa página.
Forneça o PDF, introduza 2 na seleção de páginas e inicie a operação. Depois, localize o marcador da página 2 e compare as duas informações de contagem com o que pretendia analisar, sem inferir conteúdo que não esteja no resultado apresentado. Se o documento tiver mais páginas, elas não entram nesta seleção.
O resultado contém um marcador seguido do texto da página 2, além do total de páginas do documento e do número de páginas selecionadas; esses elementos permitem confirmar o alcance pedido.
Limitações
- A conclusão depende da possibilidade de analisar o PDF, extrair o seu conteúdo textual e dispor do suporte necessário para esse processamento.
Erros comuns
- Causa: a entrada foi enviada sem dados PDF. Correção: forneça uma cadeia com os dados codificados do ficheiro antes de iniciar a operação.
Perguntas frequentes
Posso extrair o texto de todas as páginas?
Quando não define páginas específicas, a seleção predefinida abrange as páginas disponíveis do documento. Se fornecer uma lista, a operação considera as referências válidas dessa lista e mantém a numeração baseada em um.
O que acontece se indicar uma página que não existe?
Uma referência superior ao total disponível, ou inferior ao início válido, é ignorada. A informação sobre o número de páginas selecionadas permite confirmar quantas entradas da lista foram realmente consideradas.
O que faço se a extração falhar?
Se ocorrer um erro de análise do PDF ou de extração, a operação falha e apresenta a mensagem correspondente. Confirme também que a entrada contém dados e que existe suporte para interpretar o PDF antes de tentar novamente.