PDF 轉文字
讀取文字層,不做 OCR。 在這個分頁裡執行。檔案不會上傳。
$6 的日票是 24 小時,只收一次,並且不續費。 價格
這個選擇不會載入廣告指令稿。選擇留在這台瀏覽器裡。
這段文字留下什麼
這個分頁把 PDF 既有的文字層讀成純文字,下載的檔名固定是 document.txt。它先看每一頁的項目:必須同時有字串 str 和 transform 陣列,橫座標取 transform 的索引 4,縱座標取索引 5。str 修剪後若是空的就略過。基線差距在 2 個單位以內的項目合成一行,行本身依 y 由大到小,也就是頁面由上到下。行內則依 x 由左到右,相鄰的 str 之間只放一個空格。同一頁的行以換行相接,不同頁以空白行相接。若第二欄和第一欄落在同一條基線,它們會進到同一行,而不是分成兩欄。字型、圖片和欄位都不會被重建。
讀取留在這個分頁,使用開源 workers。檔案不會上傳。沒有 GridFS 複本。關閉分頁就丟掉這份複本。PDF 轉 Word 位於 /pdf-to-word,那個頁面會上傳。OCR 位於 /ocr-pdf。每一頁的圖片是 /pdf-to-jpg。
沒有公布的頁數上限。分頁必須裝得下檔案。若瀏覽器留不住這份 PDF,讀取就無法做完。這個頁面沒有帳戶。單日通行證是 $6,只收一次,為期 24 小時,不會續期。一年是 $60,共 365 天。在這裡讀文字層,兩筆費用都不需要。免費的伺服器檔案是一次 PDF 轉 Word,最多 20 頁,不是這個頁面,也不是 OCR。OCR 不是免費的。
空檔案,以及任何打不開的檔案,都會失敗並顯示 "This PDF could not be read." 有密碼的 PDF 會失敗並顯示 "This PDF is protected. Unlock it in this tab first." 這個頁面不猜測密碼。沒有頁面的 PDF 會失敗並顯示 "This PDF has no pages." 沒有文字層的掃描會失敗並顯示 "This PDF has no text layer. A scan needs OCR, which this page does not do." worker 回傳字串。它不回傳 PDF,也不呼叫 OCR。
步驟
- 放入檔案。它留在這個分頁。
- 如果這一頁有一個選項,就設定它。
- 下載結果。關閉分頁會丟掉這份副本。
問題
document.txt 裡面是什麼?
文字層。行是差距在 2 個單位以內的基線,頁面上方在前,由左到右,中間一個空格。頁與頁之間是一個空白行。檔名是 document.txt。它不是 Word 檔,也不是 PDF。欄位、字型和圖片都不會被重建。落在同一條基線的第二欄會進到同一行。
PDF 轉文字會上傳檔案嗎?
不會。它在這個分頁裡用開源 workers 執行。檔案不會上傳。沒有 GridFS 複本。關閉分頁就丟掉這份複本。會上傳的是 /pdf-to-word 的 PDF 轉 Word。
兩欄還會維持成兩欄嗎?
不會。行是差距在 2 個單位以內的基線,由左到右。落在同一條基線的第二欄會進到同一行。欄位、字型和圖片都不會被重建。下載的是 document.txt,不是 Word 檔,也不是 PDF。
如果 PDF 是掃描檔呢?
沒有文字層的掃描會被拒絕,並顯示 "This PDF has no text layer. A scan needs OCR, which this page does not do." OCR 是另一個頁面 /ocr-pdf,而且是付費上傳。單日通行證是 $6,只收一次,為期 24 小時,不會續期。一年是 $60,共 365 天。OCR 不是免費的。免費的伺服器檔案是一次 PDF 轉 Word,最多 20 頁,不是這個頁面,也不是 OCR。頁面的圖片在 /pdf-to-jpg,它留在這個分頁,不讀取字母。