PDF Commons

PDF per OCR

Diese Datei wird hochgeladen. Sie wird innerhalb von 30 Minuten gelöscht. Lokale Werkzeuge lesen keine Textbilder. Die freie Serverdatei ist PDF in Word. OCR braucht einen Tagespass für $6 oder das Jahr für $60.

Ein Pass hängt an der E-Mail aus der Kasse. Die Endzeit ist das aktive Fenster.

Schritte

  1. Legen Sie einen Scan ab. Diese Seite liest Textbilder. Sie wandelt ein PDF mit bereits auswählbarem Text nicht in Word um.
  2. Geben Sie die E-Mail aus der Zahlung ein. OCR ist nicht die freie Serverdatei.
  3. Laden Sie das PDF herunter. Die Kopie auf dem Server wird innerhalb von 30 Minuten gelöscht.

Fragen

Wird die Datei hochgeladen?

Ja. Die Browser-Werkzeuge nicht. OCR speichert den Scan und das Ergebnis in GridFS, bis die Aufbewahrung beide löscht.

Verlängert sich der Tagespass?

Nein. Er kostet $6, wird einmal belastet und endet 24 Stunden später. Das Jahr kostet $60. Wir schreiben 7 Tage vor dieser Belastung. Beide Kassen stehen auf der Preisseite. Preise

Was diese Lesung zurückgibt

Der Server macht aus jeder Seite ein PNG mit 200 Punkten je Zoll und bittet dann Tesseract um eine englische Textebene. Die Sprachmarke ist eng. Es gibt kein Sprachmenü. pdftoppm läuft einmal, mit -png, -r 200 und einem Bereich von 1 bis zur Seitenzahl. Tesseract läuft einmal je Seite und schreibt ein PDF für diese Seite. Eine Seite wird als dieses PDF zurückgegeben. Mehrere Seiten werden der Reihe nach verbunden. Der Download-Name ist immer ocr.pdf. Es ist ein PDF, keine Word-Datei. Die ursprüngliche Datei auf dem Computer wird nicht ersetzt.

Der Scan und ocr.pdf gehen in MongoDB GridFS, Bucket uploads, mit tool ocr-pdf. Die Quelle nutzt role source. Das Ergebnis nutzt role result. Die Arbeits-PNGs liegen in einem temporären Ordner und werden entfernt, wenn der Auftrag endet oder scheitert. Die Aufbewahrung löscht GridFS-Objekte, deren Upload-Zeit mindestens RETENTION_MINUTES alt ist. Ein fehlender, nullter oder nicht positiver Wert nutzt 30. Die Zeile deletions speichert die Id, den Namen, das Werkzeug, die Rolle, die Upload-Zeit und die Löschzeit, nicht die Bytes. Der Server löscht den Scan und ocr.pdf innerhalb von 30 Minuten.

Es gibt keine freie OCR-Datei. Die Sperre wird aufgerufen, während die Zahl freier Dateien schon auf 1 steht, darum wird ein Besucher ohne aktiven Kauf abgelehnt. Die Grenze liegt bei 20 Seiten, auch wenn ein Pass aktiv ist. Ein Tagespass kostet $6, wird einmal belastet, dauert 24 Stunden und verlängert sich nicht. Das Jahr kostet $60 und läuft 365 Tage. Die E-Mail muss zu einem Kauf mit Status active passen, vom Start bis vor dem Ende. Die freie Serverdatei ist PDF in Word, eine Datei, bis zu 20 Seiten, auf ihrer eigenen Seite. pdftoppm und das Tesseract jeder Seite werden nach 60 Sekunden beendet. Das Formular nimmt eine Datei.

Keine Datei, oder Bytes ohne %PDF- in den ersten 1024 Zeichen, scheitert mit "Choose a PDF." Eine Datei, deren Seitenzahl sich nicht lesen lässt, scheitert mit "This PDF could not be read." Keine Seiten scheitert mit "This PDF has no pages." Mehr als 20 Seiten scheitert mit "OCR stops at 20 pages." Ohne Pass scheitert es mit "OCR needs a $6 day pass or the $60 year. The free server file is PDF to Word. Enter the email from checkout." Wenn pdftoppm oder Tesseract fehlt, sagt die Seite "OCR is not available on this server." Ein abgelaufener oder gescheiterter Prozess endet ebenfalls als "This PDF could not be read."

Fragen

Was steht in ocr.pdf?

Ein PDF. Tesseract schreibt eine englische Textebene aus dem Bild mit 200 DPI jeder Seite. Die Seite baut Spalten nicht neu und gibt keine .docx aus. Eine Datei, die schon auswählbaren Text hat, geht trotzdem durch denselben Bildweg. PDF in Word ist die Seite, die eine vorhandene Textebene nach Word kopiert.

Ist der erste Scan frei?

Nein. PDF per OCR ist nie die freie Serverdatei. Die freie Datei ist eine Umwandlung PDF in Word, bis zu 20 Seiten, wenn diese Datei auswählbaren Text hat. Diese Seite verlangt die Zahlungs-E-Mail eines aktiven Passes, bevor sie den Scan liest.

Was bleibt nach dem Löschen?

GridFS entfernt den Scan und ocr.pdf nach der Uhr, 30 Minuten, außer RETENTION_MINUTES ist eine positive Zahl. Die Zeile deletions behält Ids und Zeiten, nicht die Bytes. Die Zeile jobs behält die Namen, die Seitenzahl, die getippte E-Mail und den Netz-Hash. Die temporären PNGs sind schon weg.

Was ändert ein Pass hier?

Ein aktiver Pass ist vor dem ersten Scan nötig. Der Tagespass kostet $6, einmal belastet, für 24 Stunden, und er verlängert sich nicht. Das Jahr kostet $60 für 365 Tage. Kündigen stoppt die nächste Jahresbelastung. Die Grenze von 20 Seiten bleibt für beide. Ein Pass fügt keine andere Sprache als Englisch hinzu und macht aus dem Ergebnis kein Word.

Außerdem