PDF Commons

PDF ke teks

Membaca lapisan teks dan tidak melakukan OCR. Berjalan di tab ini. Berkas tidak diunggah.

Tiket harian $6 berlangsung 24 jam, ditagih sekali, dan tidak diperpanjang. Harga

Pilihan ini tidak memuat skrip iklan. Pilihan tinggal di peramban ini.

Apa yang disimpan teks ini

PDF ke teks membaca lapisan teks yang sudah ada di PDF dan mengunduh document.txt. Setiap halaman menyimpan butir yang punya string str dan larik transform. x adalah indeks 4 transform dan y adalah indeks 5. Butir yang str-nya menjadi kosong setelah dipangkas diabaikan. Baris adalah garis dasar dalam 2 satuan: butir yang nilai y-nya berada dalam 2 berbagi satu baris. Baris diurutkan menurut y menurun, jadi bagian atas halaman lebih dulu. Dalam satu baris, butir diurutkan menurut x menanjak, dari kiri ke kanan, dan str-nya digabung dengan satu spasi. Baris satu halaman digabung dengan baris baru. Halaman digabung dengan baris kosong. Kolom kedua yang berbagi garis dasar jatuh pada baris yang sama. Halaman ini tidak membangun kembali kolom, font, atau gambar.

Pembacaan berjalan di tab ini dengan workers sumber terbuka. Berkas tidak diunggah. Tidak ada salinan GridFS. Menutup tab membuang salinan. PDF ke Word ada di /pdf-to-word dan halaman itu mengunggah. OCR ada di /ocr-pdf. Gambar tiap halaman adalah /pdf-to-jpg.

Tidak ada batas halaman yang diterbitkan. Tab harus menampung berkas. Jika peramban tidak dapat menahannya, pembacaan tidak selesai. Halaman ini tidak punya akun. Kartu harian $6, ditagih sekali, untuk 24 jam, dan tidak diperpanjang. Tahun adalah $60 untuk 365 hari. Kedua biaya tidak diperlukan untuk membaca lapisan teks di sini. Berkas server gratis adalah satu konversi PDF ke Word, sampai 20 halaman, dan itu bukan halaman ini dan bukan OCR. OCR tidak gratis.

Berkas kosong, dan berkas apa pun yang tidak terbuka, gagal dengan "This PDF could not be read." PDF yang dilindungi kata sandi gagal dengan "This PDF is protected. Unlock it in this tab first." Halaman ini tidak menebak kata sandi. PDF tanpa halaman gagal dengan "This PDF has no pages." Pindaian tanpa lapisan teks gagal dengan "This PDF has no text layer. A scan needs OCR, which this page does not do." Worker mengembalikan string. Ia tidak mengembalikan PDF dan tidak memanggil OCR.

Langkah

  1. Letakkan berkas. Berkas tetap di tab ini.
  2. Atur satu pilihan di halaman, jika ada.
  3. Unduh hasilnya. Menutup tab menjatuhkan salinan.

Pertanyaan

Apa isi document.txt?

Lapisan teks. Baris adalah garis dasar dalam 2 satuan, bagian atas halaman lebih dulu, dari kiri ke kanan, digabung satu spasi. Halaman dipisah baris kosong. Nama berkasnya document.txt. Bukan berkas Word dan bukan PDF. Kolom, font, dan gambar tidak dibangun kembali. Kolom kedua yang berbagi garis dasar jatuh pada baris yang sama.

Apakah PDF ke teks mengunggah berkas?

Tidak. Ia berjalan di tab ini dengan workers sumber terbuka. Berkas tidak diunggah. Tidak ada salinan GridFS. Menutup tab membuang salinan. Halaman yang mengunggah adalah PDF ke Word di /pdf-to-word.

Apakah dua kolom tetap dua kolom?

Tidak. Baris adalah garis dasar dalam 2 satuan, dari kiri ke kanan. Kolom kedua yang berbagi garis dasar jatuh pada baris yang sama. Kolom, font, dan gambar tidak dibangun kembali. Unduhan adalah document.txt, bukan berkas Word dan bukan PDF.

Bagaimana jika PDF adalah pindaian?

Pindaian tanpa lapisan teks ditolak dengan "This PDF has no text layer. A scan needs OCR, which this page does not do." OCR adalah halaman lain, /ocr-pdf, dan itu unggahan berbayar. Kartu harian $6, ditagih sekali, untuk 24 jam, dan tidak diperpanjang. Tahun adalah $60 untuk 365 hari. OCR tidak gratis. Berkas server gratis adalah satu konversi PDF ke Word, sampai 20 halaman, dan itu bukan halaman ini dan bukan OCR. Gambar halaman adalah /pdf-to-jpg, yang tetap di tab ini dan tidak membaca huruf.

Juga