PDF in Text
Liest die Textebene und macht kein OCR. Es läuft in diesem Tab. Die Datei wird nicht hochgeladen.
Ein Tagespass für $6 dauert 24 Stunden, wird einmal belastet und verlängert sich nicht. Preise
Diese Wahl lädt kein Werbeskript. Sie bleibt in diesem Browser.
Was dieser Text behält
PDF in Text liest die Textebene, die schon in der PDF steht, und lädt document.txt herunter. Jede Seite behält Einträge mit einer Zeichenkette str und einem transform-Array. x ist Index 4 von transform und y ist Index 5. Ein Eintrag, dessen str nach dem Kürzen leer ist, wird übergangen. Zeilen sind Grundlinien innerhalb von 2 Einheiten: Einträge, deren y-Werte innerhalb von 2 liegen, teilen sich eine Zeile. Die Zeilen werden nach y absteigend geordnet, also steht der obere Teil der Seite zuerst. In einer Zeile werden die Einträge nach x aufsteigend geordnet, von links nach rechts, und ihre str-Werte mit einem einzigen Leerzeichen verbunden. Die Zeilen einer Seite werden mit einem Zeilenumbruch verbunden. Seiten werden mit einer Leerzeile verbunden. Eine zweite Spalte, die dieselbe Grundlinie teilt, landet auf derselben Zeile. Diese Seite baut Spalten, Schriften oder Bilder nicht nach.
Das Lesen läuft in diesem Tab mit den Open-Source-Workern. Die Datei wird nicht hochgeladen. Es gibt keine GridFS-Kopie. Schließen des Tabs verwirft die Kopie. PDF in Word liegt unter /pdf-to-word, und diese Seite lädt hoch. OCR liegt unter /ocr-pdf. Ein Bild jeder Seite ist /pdf-to-jpg.
Es gibt keine veröffentlichte Seitenobergrenze. Der Tab muss die Datei halten. Wenn der Browser sie nicht behalten kann, endet das Lesen nicht. Diese Seite hat kein Konto. Der Tagespass kostet $6, wird einmal berechnet, gilt 24 Stunden und verlängert sich nicht. Das Jahr kostet $60 für 365 Tage. Keine der beiden Gebühren ist nötig, um hier eine Textebene zu lesen. Die kostenlose Serverdatei ist eine Umwandlung von PDF in Word, bis zu 20 Seiten, und sie ist nicht diese Seite und nicht OCR. OCR ist nicht kostenlos.
Eine leere Datei, und jede Datei, die sich nicht öffnen lässt, scheitert mit "This PDF could not be read." Eine passwortgeschützte PDF scheitert mit "This PDF is protected. Unlock it in this tab first." Diese Seite rät kein Passwort. Eine PDF ohne Seiten scheitert mit "This PDF has no pages." Ein Scan ohne Textebene scheitert mit "This PDF has no text layer. A scan needs OCR, which this page does not do." Der Worker gibt die Zeichenkette zurück. Er gibt keine PDF zurück und ruft kein OCR auf.
Schritte
- Legen Sie die Datei ab. Sie bleibt in diesem Tab.
- Stellen Sie die eine Option der Seite ein, falls es eine gibt.
- Laden Sie das Ergebnis herunter. Schließen des Tabs verwirft die Kopie.
Fragen
Was steht in document.txt?
Die Textebene. Zeilen sind Grundlinien innerhalb von 2 Einheiten, der obere Teil der Seite zuerst, von links nach rechts, verbunden mit einem einzigen Leerzeichen. Seiten werden durch eine Leerzeile getrennt. Die Datei heißt document.txt. Sie ist keine Word-Datei und keine PDF. Spalten, Schriften und Bilder werden nicht nachgebaut. Eine zweite Spalte, die dieselbe Grundlinie teilt, landet auf derselben Zeile.
Lädt PDF in Text die Datei hoch?
Nein. Es läuft in diesem Tab mit den Open-Source-Workern. Die Datei wird nicht hochgeladen. Es gibt keine GridFS-Kopie. Schließen des Tabs verwirft die Kopie. PDF in Word unter /pdf-to-word ist die Seite, die hochlädt.
Bleiben zwei Spalten zwei Spalten?
Nein. Zeilen sind Grundlinien innerhalb von 2 Einheiten, von links nach rechts. Eine zweite Spalte, die dieselbe Grundlinie teilt, landet auf derselben Zeile. Spalten, Schriften und Bilder werden nicht nachgebaut. Der Download ist document.txt, keine Word-Datei und keine PDF.
Was ist, wenn die PDF ein Scan ist?
Ein Scan ohne Textebene wird abgelehnt mit "This PDF has no text layer. A scan needs OCR, which this page does not do." OCR ist eine andere Seite, /ocr-pdf, und ein bezahlter Upload. Der Tagespass kostet $6, wird einmal berechnet, gilt 24 Stunden und verlängert sich nicht. Das Jahr kostet $60 für 365 Tage. OCR ist nicht kostenlos. Die kostenlose Serverdatei ist eine Umwandlung von PDF in Word, bis zu 20 Seiten, und sie ist nicht diese Seite und nicht OCR. Bilder einer Seite sind /pdf-to-jpg, das in diesem Tab bleibt und die Buchstaben nicht liest.