PDF Commons

PDF kepada teks

Membaca lapisan teks dan tidak membuat OCR. Ia berjalan dalam tab ini. Fail tidak dimuat naik.

Pas harian $6 berlangsung 24 jam, dicaj sekali, dan tidak diperbaharui. Harga

Pilihan ini tidak memuatkan skrip iklan. Pilihan kekal di pelayar ini.

Apa yang disimpan oleh teks ini

Alat ini mengambil lapisan teks yang PDF sudah simpan, lalu menurunkan document.txt. Ia bukan fail Word dan bukan PDF. Pada setiap halaman, hanya item yang ada rentetan str serta tatasusunan transform dikekalkan. Kedudukan x ialah indeks 4 transform, kedudukan y ialah indeks 5. Item yang str-nya kosong selepas dipangkas dibuang. Satu baris bermaksud garis dasar: item yang y-nya berada dalam lingkungan 2 unit berkongsi baris itu. Baris disusun y menurun supaya atas halaman dahulu. Dalam baris, item disusun x menaik, kiri ke kanan, dan str dicantum dengan satu ruang. Baris satu halaman dicantum dengan baris baharu. Halaman dicantum dengan satu baris kosong. Lajur kedua yang berkongsi garis dasar yang sama masuk ke baris yang sama, bukan kekal sebagai dua lajur. Lajur, fon, dan gambar tidak dibina semula.

Pembacaan berlaku dalam tab ini dengan workers sumber terbuka. Fail tidak dimuat naik. Tiada salinan GridFS. Menutup tab membuang salinan. PDF ke Word ada di /pdf-to-word dan halaman itu memuat naik. OCR ada di /ocr-pdf. Gambar setiap halaman ialah /pdf-to-jpg.

Tiada siling halaman yang diterbitkan. Tab mesti memegang fail. Jika pelayar tidak dapat menyimpannya, pembacaan tidak selesai. Halaman ini tiada akaun. Pas harian ialah $6, dicaj sekali, untuk 24 jam, dan tidak diperbaharui. Setahun ialah $60 untuk 365 hari. Tiada satu pun daripada dua caj itu diperlukan untuk membaca lapisan teks di sini. Fail pelayan percuma ialah satu penukaran PDF ke Word, sehingga 20 halaman, dan ia bukan halaman ini dan bukan OCR. OCR bukan percuma.

Fail kosong, dan mana-mana fail yang tidak terbuka, gagal dengan "This PDF could not be read." PDF yang dilindungi kata laluan gagal dengan "This PDF is protected. Unlock it in this tab first." Halaman ini tidak meneka kata laluan. PDF tanpa halaman gagal dengan "This PDF has no pages." Imbasan tanpa lapisan teks gagal dengan "This PDF has no text layer. A scan needs OCR, which this page does not do." Worker memulangkan rentetan. Ia tidak memulangkan PDF dan tidak memanggil OCR.

Langkah

  1. Letakkan fail. Ia kekal dalam tab ini.
  2. Tetapkan satu pilihan pada halaman, jika ada.
  3. Muat turun hasil. Menutup tab menggugurkan salinan.

Soalan

Apa yang ada dalam document.txt?

Lapisan teks. Baris ialah garis dasar dalam lingkungan 2 unit, atas halaman dahulu, kiri ke kanan, dicantum dengan satu ruang. Halaman dipisah dengan baris kosong. Nama fail ialah document.txt. Bukan fail Word dan bukan PDF. Lajur, fon, dan gambar tidak dibina semula. Lajur kedua yang berkongsi garis dasar masuk ke baris yang sama.

Adakah PDF kepada teks memuat naik fail?

Tidak. Ia berjalan dalam tab ini dengan workers sumber terbuka. Fail tidak dimuat naik. Tiada salinan GridFS. Menutup tab membuang salinan. Halaman yang memuat naik ialah PDF ke Word di /pdf-to-word.

Adakah dua lajur kekal dua lajur?

Tidak. Baris ialah garis dasar dalam lingkungan 2 unit, kiri ke kanan. Lajur kedua yang berkongsi garis dasar masuk ke baris yang sama. Lajur, fon, dan gambar tidak dibina semula. Muat turun ialah document.txt, bukan fail Word dan bukan PDF.

Bagaimana jika PDF ialah imbasan?

Imbasan tanpa lapisan teks ditolak dengan "This PDF has no text layer. A scan needs OCR, which this page does not do." OCR ialah halaman lain, /ocr-pdf, dan ia muat naik berbayar. Pas harian ialah $6, dicaj sekali, untuk 24 jam, dan tidak diperbaharui. Setahun ialah $60 untuk 365 hari. OCR bukan percuma. Fail pelayan percuma ialah satu penukaran PDF ke Word, sehingga 20 halaman, dan ia bukan halaman ini dan bukan OCR. Gambar halaman ialah /pdf-to-jpg, yang kekal dalam tab ini dan tidak membaca huruf.

Juga