PDFからテキストを抽出する方法
PDFデータを入力し、必要なら1始まりのページ番号を指定すると、選択ページのテキストをページマーカー付きで取得できます。ページ指定を省略した場合は全ページが対象です。
PDFのテキストを取り出す準備
PDFから本文のテキストを取り出したいときは、PDFファイルを入力し、必要に応じてページ番号を指定します。ページを指定しなければ全ページが対象になります。ページごとの内容を確認したい資料や、必要な範囲だけを扱いたい資料に向いています。
PDFからテキストを抽出する手順
- PDFファイルを入力します。入力には、PDFデータをエンコードした文字列を使用します。入力が空の場合、処理は失敗します。
- 必要ならページ番号を指定します。複数ページはカンマ区切りの1始まりの整数で入力します。ページ指定を省略すると、全ページが選択されます。
- PDFの内容を処理します。指定したページ番号が文書のページ範囲外にある場合、その番号は選択対象から外れます。
- 抽出結果を確認します。選択された各ページの前にはページを示すマーカーが付き、ページごとのテキストがまとめて表示されます。あわせて、文書全体のページ数と選択されたページ数も確認できます。
抽出結果の見方と注意点
結果には、選択したページの抽出テキストとページ情報が含まれます。ページマーカーを手がかりにすれば、まとまったテキストの中で各ページの境界を確認できます。ページ番号を指定した場合は、文書の総ページ数と選択ページ数を照らし合わせると、範囲外の番号が対象外になったことも把握できます。
PDFの解析またはテキスト抽出でエラーが発生した場合、処理は失敗し、発生したエラーメッセージが示されます。必要なPDF解析機能が利用できない場合も処理は失敗します。画像だけで構成されたPDFがOCRで読めるかどうかは、この動作からは判断できません。また、ページ指定に整数へ変換できない文字を含めると、無視されず失敗することがあります。
使用例
3ページのPDFから1ページ目と3ページ目の本文だけを確認したい場合です。
3ページあるPDFデータを入力し、ページ指定に「1,3」を設定して処理します。
選択した2ページ分のテキストが、それぞれページマーカーの後に表示され、文書の総ページ数と選択ページ数も示されます。
制限事項
- PDF解析やテキスト抽出でエラーが発生した場合、または必要なPDF解析機能が利用できない場合は処理できません。画像だけのPDFをOCRで処理できるかどうかも確認されていません。
よくある間違い
- 入力が空、またはPDFデータとして処理できない内容になっている可能性があります。PDFデータをエンコードした文字列を入力し、ページ指定を使う場合は整数だけで構成されているか確認してから再実行してください。
よくある質問
ページを指定しない場合はどうなりますか?
ページ指定を省略すると、文書の全ページが選択されます。特定の範囲だけが必要な場合は、1始まりのページ番号をカンマ区切りで指定します。
存在しないページ番号を指定するとどうなりますか?
文書のページ範囲外にある番号は選択対象から外れます。ただし、整数に変換できない文字をページ指定に含めた場合は、無視されず処理が失敗することがあります。
スキャンしたPDFの文字も抽出できますか?
画像だけで構成されたPDFをOCRで処理できるかどうかは、確認された動作には含まれていません。PDF解析やテキスト抽出でエラーが発生した場合は、処理が失敗し、エラーメッセージが示されます。