PDF a text
Llegeix la capa de text i no fa OCR. S'executa en aquesta pestanya. El fitxer no es puja.
Un passi de dia de $6 dura 24 hores, es cobra una vegada i no es renova. Preus
Aquesta tria no carrega un script d'anuncis. Es queda en aquest navegador.
Què conserva aquest text
Aquesta pàgina llegeix la capa de text que el PDF ja duu i en fa baixar document.txt. No és un Word ni un PDF. Per a cada pàgina es queden els elements amb una cadena str i una matriu transform: la x és l'índex 4 i la y és l'índex 5. Si str, un cop retallat, és buit, l'element es deixa fora. La línia és una línia de base: els elements amb una y dins de 2 unitats comparteixen la línia. L'ordre de les línies és y descendent, o sigui el capdamunt de la pàgina primer. Dins la línia, l'ordre és x ascendent, d'esquerra a dreta, i els str s'uneixen amb un sol espai. Les línies d'una pàgina s'uneixen amb un salt, i les pàgines amb una línia en blanc. Si una segona columna comparteix la línia de base, cau en aquella mateixa línia. Ni les columnes, ni les fonts, ni les imatges es reconstrueixen.
La lectura es fa en aquesta pestanya amb els workers de codi obert. El fitxer no es puja. No hi ha còpia a GridFS. En tancar la pestanya es descarta la còpia. PDF a Word és a /pdf-to-word i aquella pàgina sí que puja el fitxer. L'OCR és a /ocr-pdf. Una imatge de cada pàgina és /pdf-to-jpg.
No hi ha un sostre de pàgines publicat. La pestanya ha de guardar el fitxer. Si el navegador no el pot retenir, la lectura no s'acaba. Aquesta pàgina no té compte. Un passi d'un dia és $6, es cobra una vegada, dura 24 hores i no es renova. Un any és $60 per 365 dies. Cap dels dos cobraments no cal per llegir una capa de text aquí. El fitxer gratuït del servidor és una conversió de PDF a Word, fins a 20 pàgines, i no és aquesta pàgina ni l'OCR. L'OCR no és gratuït.
Un fitxer buit, i qualsevol que no s'obre, falla amb "This PDF could not be read." Un PDF protegit amb contrasenya falla amb "This PDF is protected. Unlock it in this tab first." Aquesta pàgina no endevina cap contrasenya. Un PDF sense pàgines falla amb "This PDF has no pages." Un escaneig sense capa de text falla amb "This PDF has no text layer. A scan needs OCR, which this page does not do." El worker retorna la cadena. No retorna un PDF i no crida l'OCR.
Passos
- Deixa el fitxer. Es queda en aquesta pestanya.
- Ajusta l'única opció de la pàgina, si n'hi ha.
- Descarrega el resultat. Tancar la pestanya deixa anar la còpia.
Preguntes
Què hi ha dins document.txt?
La capa de text. Les línies són línies de base dins de 2 unitats, primer el capdamunt de la pàgina, d'esquerra a dreta, unides per un sol espai. Les pàgines se separen amb una línia en blanc. El fitxer es diu document.txt. No és un fitxer de Word ni un PDF. No es reconstrueixen columnes, fonts ni imatges. Una segona columna que comparteix la línia de base cau en aquella mateixa línia.
PDF a text puja el fitxer?
No. S'executa en aquesta pestanya amb els workers de codi obert. El fitxer no es puja. No hi ha còpia a GridFS. En tancar la pestanya es descarta la còpia. La pàgina que puja és PDF a Word a /pdf-to-word.
Dues columnes continuen sent dues columnes?
No. Les línies són línies de base dins de 2 unitats, d'esquerra a dreta. Una segona columna que comparteix la línia de base cau en aquella mateixa línia. No es reconstrueixen columnes, fonts ni imatges. La baixada és document.txt, no un fitxer de Word i no un PDF.
I si el PDF és un escaneig?
Un escaneig sense capa de text es rebutja amb "This PDF has no text layer. A scan needs OCR, which this page does not do." L'OCR és una altra pàgina, /ocr-pdf, i és una pujada de pagament. Un passi d'un dia és $6, es cobra una vegada, dura 24 hores i no es renova. Un any és $60 per 365 dies. L'OCR no és gratuït. El fitxer gratuït del servidor és una conversió de PDF a Word, fins a 20 pàgines, i no és aquesta pàgina ni l'OCR. Les imatges d'una pàgina són /pdf-to-jpg, que es queda en aquesta pestanya i no llegeix les lletres.