PDF Commons

PDF in testo

Legge il livello di testo e non fa l'OCR. Funziona in questa scheda. Il file non viene caricato.

Un pass giornaliero da $6 dura 24 ore, si addebita una volta e non si rinnova. Prezzi

Questa scelta non carica uno script pubblicitario. Resta in questo browser.

Che cosa conserva questo testo

PDF in testo legge il livello di testo già presente nel PDF e scarica document.txt. Ogni pagina tiene gli elementi che hanno una stringa str e un array transform. x è l'indice 4 di transform e y è l'indice 5. Un elemento il cui str, una volta tagliato, è vuoto viene ignorato. Le righe sono linee di base entro 2 unità: gli elementi i cui valori y stanno entro 2 condividono una riga. Le righe sono ordinate per y decrescente, così la parte alta della pagina viene prima. Dentro una riga gli elementi sono ordinati per x crescente, da sinistra a destra, e i loro str sono uniti da un solo spazio. Le righe di una pagina sono unite da un a capo. Le pagine sono unite da una riga vuota. Una seconda colonna che condivide la linea di base finisce su quella stessa riga. Questa pagina non ricostruisce colonne, font o immagini.

La lettura avviene in questa scheda con i worker open source. Il file non viene caricato. Non c'è una copia in GridFS. Chiudere la scheda scarta la copia. PDF in Word è su /pdf-to-word e quella pagina carica il file. L'OCR è su /ocr-pdf. Un'immagine di ogni pagina è /pdf-to-jpg.

Non c'è un tetto di pagine pubblicato. La scheda deve tenere il file. Se il browser non può conservarlo, la lettura non finisce. Questa pagina non ha un account. Un pass giornaliero è $6, addebitato una volta, per 24 ore, e non si rinnova. L'anno è $60 per 365 giorni. Nessuno dei due addebiti serve per leggere un livello di testo qui. Il file gratuito del server è una conversione da PDF a Word, fino a 20 pagine, e non è questa pagina né l'OCR. L'OCR non è gratuito.

Un file vuoto, e qualunque file che non si apre, fallisce con "This PDF could not be read." Un PDF protetto da password fallisce con "This PDF is protected. Unlock it in this tab first." Questa pagina non indovina una password. Un PDF senza pagine fallisce con "This PDF has no pages." Una scansione senza livello di testo fallisce con "This PDF has no text layer. A scan needs OCR, which this page does not do." Il worker restituisce la stringa. Non restituisce un PDF e non chiama l'OCR.

Passi

  1. Lascia il file. Resta in questa scheda.
  2. Imposta l'unica opzione della pagina, se c'è.
  3. Scarica il risultato. Chiudere la scheda lascia cadere la copia.

Domande

Che cosa contiene document.txt?

Il livello di testo. Le righe sono linee di base entro 2 unità, prima la parte alta della pagina, da sinistra a destra, unite da un solo spazio. Le pagine sono separate da una riga vuota. Il file si chiama document.txt. Non è un file Word e non è un PDF. Colonne, font e immagini non vengono ricostruiti. Una seconda colonna che condivide la linea di base finisce su quella stessa riga.

PDF in testo carica il file?

No. Funziona in questa scheda con i worker open source. Il file non viene caricato. Non c'è una copia in GridFS. Chiudere la scheda scarta la copia. PDF in Word su /pdf-to-word è la pagina che carica.

Due colonne restano due colonne?

No. Le righe sono linee di base entro 2 unità, da sinistra a destra. Una seconda colonna che condivide la linea di base finisce su quella stessa riga. Colonne, font e immagini non vengono ricostruiti. Lo scaricamento è document.txt, non un file Word e non un PDF.

E se il PDF è una scansione?

Una scansione senza livello di testo viene rifiutata con "This PDF has no text layer. A scan needs OCR, which this page does not do." L'OCR è un'altra pagina, /ocr-pdf, ed è un caricamento a pagamento. Un pass giornaliero è $6, addebitato una volta, per 24 ore, e non si rinnova. L'anno è $60 per 365 giorni. L'OCR non è gratuito. Il file gratuito del server è una conversione da PDF a Word, fino a 20 pagine, e non è questa pagina né l'OCR. Le immagini di una pagina sono /pdf-to-jpg, che resta in questa scheda e non legge le lettere.

Anche