PDF → TXT

从PDF中提取文本. 直接在浏览器中使用。100%免费,保护隐私。

PDF → TXT 将 PDF 的文本内容提取到纯文本文件中,去除布局、字体和图像,只保留文字。当文本需要输入脚本、分析工具、翻译工作流或搜索索引时,这正是您所需要的,因为 PDF 结构只会碍事。提取过程会尽可能保留原始文档的阅读顺序和段落分隔。它在您的浏览器中运行,无需上传文件。

  1. 上传文件 — 将文件拖放到上传区域,或点击浏览并从您的设备中选择文件。
  2. 设置选项 — 从PDF中提取文本
  3. 下载 — 点击下载按钮保存您处理后的文件。即时可用!

常见问题

它能处理扫描的 PDF 吗?

不能。扫描件包含的是文本图像,而不是文本本身。请先使用 OCR 工具处理,该工具能识别字符并添加真实的文本层。

布局会被保留吗?

不会,这是刻意为之——纯文本没有分栏或定位。特别是多栏布局会被扁平化为单一的阅读顺序。

输出文件的编码是什么?

UTF-8,因此带重音符号的字符和非拉丁字母脚本都能完整保留。

为什么有些文本会丢失?

通常是因为页面某些部分是图像而不是文本,或者 PDF 使用的字体字符映射损坏。OCR 可以处理第一种情况。

转换