PDF 转文本
读取文本层,不做 OCR。 在这个标签页里运行。文件不会上传。
$6 的日票是 24 小时,只收一次,并且不续费。 价格
这个选择不会加载广告脚本。选择留在这台浏览器里。
这段文本留下什么
PDF 转文本读取 PDF 里已经存在的文本层,并下载 document.txt。每一页只保留带有字符串 str 和 transform 数组的项。x 是 transform 的第 4 个下标,y 是第 5 个下标。str 去掉两端空白后为空的项会被忽略。行是相距不超过 2 个单位的基线:y 相差在 2 以内的项算同一行。行按 y 从大到小排列,所以页面上方在前。同一行里的项按 x 从小到大、从左到右排列,它们的 str 用一个空格连起来。一页里的行用换行连接。页与页之间用一个空行连接。共享同一条基线的第二栏会落在同一行上。本页不重建分栏、字体或图片。
读取在这个标签页里进行,用的是开源 workers。文件不会上传。没有 GridFS 副本。关闭标签页就丢掉这份副本。PDF 转 Word 在 /pdf-to-word,那个页面会上传。OCR 在 /ocr-pdf。每一页的图片是 /pdf-to-jpg。
没有公布的页数上限。标签页必须装得下文件。如果浏览器留不住这份 PDF,读取就无法完成。这个页面没有账户。单日通行证是 $6,只收一次,有效 24 小时,不会续期。一年是 $60,共 365 天。在这里读取文本层,两笔费用都不需要。免费的服务器文件是一次 PDF 转 Word,最多 20 页,不是这个页面,也不是 OCR。OCR 不是免费的。
空文件,以及任何打不开的文件,都会失败并显示 "This PDF could not be read." 有密码的 PDF 会失败并显示 "This PDF is protected. Unlock it in this tab first." 这个页面不猜测密码。没有页面的 PDF 会失败并显示 "This PDF has no pages." 没有文本层的扫描件会失败并显示 "This PDF has no text layer. A scan needs OCR, which this page does not do." worker 返回字符串。它不返回 PDF,也不调用 OCR。
步骤
- 放入文件。它留在这个标签页。
- 如果这一页有一个选项,就设置它。
- 下载结果。关闭标签页会丢掉这份副本。
问题
document.txt 里有什么?
文本层。行是相距不超过 2 个单位的基线,页面上方在前,从左到右,用一个空格连接。页与页之间是一个空行。文件名叫 document.txt。它不是 Word 文件,也不是 PDF。分栏、字体和图片都不会被重建。共享同一条基线的第二栏会落在同一行上。
PDF 转文本会上传文件吗?
不会。它在这个标签页里用开源 workers 运行。文件不会上传。没有 GridFS 副本。关闭标签页就丢掉这份副本。会上传的是 /pdf-to-word 上的 PDF 转 Word。
两栏还会保持成两栏吗?
不会。行是相距不超过 2 个单位的基线,从左到右。共享同一条基线的第二栏会落在同一行上。分栏、字体和图片都不会被重建。下载的是 document.txt,不是 Word 文件,也不是 PDF。
如果 PDF 是扫描件呢?
没有文本层的扫描件会被拒绝,并显示 "This PDF has no text layer. A scan needs OCR, which this page does not do." OCR 是另一个页面 /ocr-pdf,而且是付费上传。单日通行证是 $6,只收一次,有效 24 小时,不会续期。一年是 $60,共 365 天。OCR 不是免费的。免费的服务器文件是一次 PDF 转 Word,最多 20 页,不是这个页面,也不是 OCR。页面的图片在 /pdf-to-jpg,它留在这个标签页里,不读取字母。