PDF Commons

PDF'den metne

Metin katmanını okur ve OCR yapmaz. Bu sekmede çalışır. Dosya yüklenmez.

$6 günlük geçiş 24 saat sürer, bir kez çekilir ve yenilenmez. Fiyatlar

Bu seçim reklam betiği yüklemez. Bu tarayıcıda kalır.

Bu metin neyi tutar

PDF'den metne, PDF'de zaten bulunan metin katmanını okur ve document.txt indirir. Her sayfa, str dizisi ve transform dizisi olan öğeleri tutar. x, transform'un 4. indeksi, y ise 5. indeksidir. str kırpılınca boş kalan öğe yok sayılır. Satırlar 2 birim içindeki taban çizgileridir: y değerleri 2 içinde olan öğeler bir satırı paylaşır. Satırlar y azalan sıradadır, bu yüzden sayfanın üstü önce gelir. Bir satırda öğeler x artan sırada, soldan sağa dizilir ve str değerleri tek bir boşlukla birleşir. Bir sayfanın satırları satır sonuyla birleşir. Sayfalar boş bir satırla birleşir. Aynı taban çizgisini paylaşan ikinci sütun aynı satıra düşer. Bu sayfa sütunları, yazı tiplerini veya resimleri yeniden kurmaz.

Okuma bu sekmede, açık kaynak workers ile yapılır. Dosya yüklenmez. GridFS kopyası yoktur. Sekmeyi kapatmak kopyayı düşürür. PDF'den Word'e /pdf-to-word adresindedir ve o sayfa yükler. OCR /ocr-pdf adresindedir. Her sayfanın resmi /pdf-to-jpg adresindedir.

Yayımlanmış bir sayfa tavanı yoktur. Sekme dosyayı tutmak zorundadır. Tarayıcı PDF'yi tutamazsa okuma bitmez. Bu sayfanın hesabı yoktur. Günlük geçiş $6 tutarındadır, bir kez çekilir, 24 saattir ve yenilenmez. Yıl 365 gün için $60 tutarındadır. Burada bir metin katmanı okumak için iki ücretten hiçbiri gerekmez. Ücretsiz sunucu dosyası, 20 sayfaya kadar bir PDF'den Word'e dönüşümüdür ve bu sayfa değildir, OCR da değildir. OCR ücretsiz değildir.

Boş bir dosya ve açılamayan her dosya "This PDF could not be read." ile başarısız olur. Parolayla korunan bir PDF "This PDF is protected. Unlock it in this tab first." ile başarısız olur. Bu sayfa parola tahmin etmez. Sayfası olmayan bir PDF "This PDF has no pages." ile başarısız olur. Metin katmanı olmayan bir tarama "This PDF has no text layer. A scan needs OCR, which this page does not do." ile başarısız olur. Worker diziyi döndürür. PDF döndürmez ve OCR çağırmaz.

Adımlar

  1. Dosyayı bırakın. Bu sekmede kalır.
  2. Sayfada bir seçenek varsa onu ayarlayın.
  3. Sonucu indirin. Sekmeyi kapatmak kopyayı düşürür.

Sorular

document.txt ne içerir?

Metin katmanını. Satırlar 2 birim içindeki taban çizgileridir, önce sayfanın üstü, soldan sağa, tek bir boşlukla birleşir. Sayfalar boş bir satırla ayrılır. Dosyanın adı document.txt'tir. Bir Word dosyası değildir ve bir PDF değildir. Sütunlar, yazı tipleri ve resimler yeniden kurulmaz. Aynı taban çizgisini paylaşan ikinci sütun aynı satıra düşer.

PDF'den metne dosyayı yükler mi?

Hayır. Açık kaynak workers ile bu sekmede çalışır. Dosya yüklenmez. GridFS kopyası yoktur. Sekmeyi kapatmak kopyayı düşürür. Yükleyen sayfa /pdf-to-word adresindeki PDF'den Word'e'dir.

İki sütun iki sütun kalır mı?

Hayır. Satırlar 2 birim içindeki taban çizgileridir, soldan sağa. Aynı taban çizgisini paylaşan ikinci sütun aynı satıra düşer. Sütunlar, yazı tipleri ve resimler yeniden kurulmaz. İndirme document.txt'tir, bir Word dosyası değildir ve bir PDF değildir.

PDF bir tarama ise ne olur?

Metin katmanı olmayan bir tarama "This PDF has no text layer. A scan needs OCR, which this page does not do." ile reddedilir. OCR başka bir sayfadır, /ocr-pdf, ve ücretli bir yüklemedir. Günlük geçiş $6 tutarındadır, bir kez çekilir, 24 saattir ve yenilenmez. Yıl 365 gün için $60 tutarındadır. OCR ücretsiz değildir. Ücretsiz sunucu dosyası, 20 sayfaya kadar bir PDF'den Word'e dönüşümüdür ve bu sayfa değildir, OCR da değildir. Bir sayfanın resimleri /pdf-to-jpg adresindedir, bu sekmede kalır ve harfleri okumaz.

Ayrıca