PDF till text
Läser textlagret och gör inte OCR. Det körs i den här fliken. Filen laddas inte upp.
Ett dagspass för $6 varar 24 timmar, dras en gång och förnyas inte. Priser
Det här valet laddar inget annonsskript. Det stannar i den här webbläsaren.
Vad den här texten behåller
PDF till text läser textlagret som redan finns i PDF:en och hämtar document.txt. Varje sida behåller poster som har en sträng str och en transform-array. x är index 4 i transform och y är index 5. En post vars str blir tom efter trimning hoppas över. Rader är baslinjer inom 2 enheter: poster vars y-värden ligger inom 2 delar en rad. Rader ordnas efter y fallande, så sidans överdel kommer först. Inom en rad ordnas poster efter x stigande, från vänster till höger, och deras str fogas med ett enda mellanslag. Rader på en sida fogas med en radbrytning. Sidor fogas med en tom rad. En andra spalt som delar baslinjen hamnar på samma rad. Den här sidan återskapar inte spalter, typsnitt eller bilder.
Läsningen körs i den här fliken med workers med öppen källkod. Filen laddas inte upp. Det finns ingen GridFS-kopia. Att stänga fliken släpper kopian. PDF till Word finns på /pdf-to-word och den sidan laddar upp. OCR finns på /ocr-pdf. En bild av varje sida är /pdf-to-jpg.
Det finns inget publicerat sidtak. Fliken måste rymma filen. Om webbläsaren inte kan hålla PDF:en kan läsningen inte bli klar. Den här sidan har inget konto. Ett dagspass är $6, debiteras en gång, i 24 timmar, och förnyas inte. Ett år är $60 för 365 dagar. Ingen av avgifterna krävs för att läsa ett textlager här. Den fria serverfilen är en konvertering från PDF till Word, upp till 20 sidor, och den är inte den här sidan och inte OCR. OCR är inte gratis.
En tom fil, och varje fil som inte går att öppna, misslyckas med "This PDF could not be read." En lösenordsskyddad PDF misslyckas med "This PDF is protected. Unlock it in this tab first." Den här sidan gissar inget lösenord. En PDF utan sidor misslyckas med "This PDF has no pages." En skanning utan textlager misslyckas med "This PDF has no text layer. A scan needs OCR, which this page does not do." Workern returnerar strängen. Den returnerar inte en PDF och anropar inte OCR.
Steg
- Släpp filen. Den stannar i den här fliken.
- Ställ in sidans enda val, om det finns ett.
- Hämta resultatet. Att stänga fliken släpper kopian.
Frågor
Vad innehåller document.txt?
Textlagret. Rader är baslinjer inom 2 enheter, sidans överdel först, från vänster till höger, fogade med ett mellanslag. Sidor skiljs av en tom rad. Filen heter document.txt. Den är inte en Word-fil och inte en PDF. Spalter, typsnitt och bilder återskapas inte. En andra spalt som delar baslinjen hamnar på samma rad.
Laddar PDF till text upp filen?
Nej. Det körs i den här fliken med workers med öppen källkod. Filen laddas inte upp. Det finns ingen GridFS-kopia. Att stänga fliken släpper kopian. Sidan som laddar upp är PDF till Word på /pdf-to-word.
Förblir två spalter två spalter?
Nej. Rader är baslinjer inom 2 enheter, från vänster till höger. En andra spalt som delar baslinjen hamnar på samma rad. Spalter, typsnitt och bilder återskapas inte. Hämtningen är document.txt, inte en Word-fil och inte en PDF.
Om PDF:en är en skanning?
En skanning utan textlager avvisas med "This PDF has no text layer. A scan needs OCR, which this page does not do." OCR är en annan sida, /ocr-pdf, och det är en betald uppladdning. Ett dagspass är $6, debiteras en gång, i 24 timmar, och förnyas inte. Ett år är $60 för 365 dagar. OCR är inte gratis. Den fria serverfilen är en konvertering från PDF till Word, upp till 20 sidor, och den är inte den här sidan och inte OCR. Bilder av en sida är /pdf-to-jpg, som stannar i den här fliken och inte läser bokstäverna.