如何从 PDF 文件中提取文本内容
提供编码后的 PDF 文件数据;不指定页面时处理整份文档,指定页码时按所选页面提取文字并返回页面信息。
先了解工具能做什么
PDF 转文本工具适合把 PDF 文件中的文字内容整理成可复制、可查看的文本结果。你可以处理整份文档,也可以只选择指定页面;当文档较长、只需要核对其中几页,或准备后续编辑时,按页提取会更方便。
操作步骤:从 PDF 提取文字
- 准备 PDF 文件,并将其作为编码后的 PDF 文件数据提供给工具。文件输入不能是空内容,否则操作会失败。
- 不指定页面时,工具默认处理文档的全部页面。若只需部分内容,请填写以英文逗号分隔的页码,例如
2,5,8。页码按从 1 开始的整数理解。 - 提交处理请求,等待文本提取完成。若填写的页码超出文档页数,这些页码会被跳过;但不要填写无法转换为整数的页码文字,因为这可能导致操作失败。
- 打开结果,按页面标记查看对应文本。需要整合内容时,可复制文本结果;需要核对范围时,查看返回的文档总页数和已选页数。
如何阅读结果及判断边界
成功后,结果会包含所选页面的提取文本,并提供文档总页数和已选页数。多页结果会把各页文字合并到较大的文本结果中,并在对应页面文字前加入页面标记,因此可以据此区分来源页面。
如果没有指定页面,结果范围按整份文档处理;如果指定了页面,超出范围的页码不会产生对应页面内容。PDF 解析或文字提取发生错误时,操作会失败并显示相关错误信息;如果所需的 PDF 解析支持不可用,也无法完成处理。对于扫描件或纯图片 PDF,当前资料没有确认是否支持 OCR,因此不要预期一定能提取出图片中的文字。
使用示例
你只想核对一份 6 页 PDF 的第 2 页和第 5 页,因此选择 2,5,9 作为页面输入。
提供一份 6 页 PDF 文件数据,在页面选择中填写 2,5,9 后提交处理,并查看返回的文本和页数信息。
结果包含文档总页数、已选页数,以及分别带页面标记的第 2 页和第 5 页文本;第 9 页因超出范围而不产生对应内容。
使用限制
- 处理依赖 PDF 解析和文字提取是否成功;扫描件或纯图片 PDF 是否支持 OCR 尚未确认。
常见错误
- 页码填写了字母、空值等无法转换为整数的内容,或文件数据为空,都会使处理失败。请改用以逗号分隔的整数页码,并确认已提供非空的编码后 PDF 文件数据。
常见问题
可以只提取 PDF 的指定页面吗?
可以。默认会处理整份 PDF;填写以逗号分隔的页码后,则按指定页面处理,超出文档范围的页码会被跳过。
可以提交空的文件输入吗?
不可以。空文件输入会导致操作失败;请提供包含内容的编码后 PDF 文件数据。
处理失败或扫描 PDF 没有文字时怎么办?
如果 PDF 解析或文字提取出错,操作会失败并显示相关错误信息;所需的 PDF 解析支持不可用时也会失败。扫描件是否能通过 OCR 提取文字,目前没有得到确认。