PDF a texto
Lee la capa de texto y no hace OCR. Se ejecuta en esta pestaña. El archivo no se sube.
Un pase de día de $6 dura 24 horas, se cobra una vez y no se renueva. Precios
Esta elección no carga un script de anuncios. Se queda en este navegador.
Qué conserva este texto
PDF a texto lee la capa de texto que ya está en el PDF y descarga document.txt. Cada página conserva los elementos que tienen una cadena str y un arreglo transform. x es el índice 4 de transform e y es el índice 5. Se ignora el elemento cuyo str, al recortarlo, queda vacío. Las líneas son líneas de base dentro de 2 unidades: los elementos cuya y queda dentro de 2 comparten una línea. Las líneas se ordenan por y descendente, de modo que la parte alta de la página va primero. Dentro de una línea, los elementos se ordenan por x ascendente, de izquierda a derecha, y sus str se unen con un solo espacio. Las líneas de una página se unen con un salto de línea. Las páginas se unen con una línea en blanco. Una segunda columna que comparte la línea de base cae en esa misma línea. Esta página no reconstruye columnas, fuentes ni imágenes.
La lectura corre en esta pestaña con los workers de código abierto. El archivo no se sube. No hay copia en GridFS. Al cerrar la pestaña se descarta la copia. PDF a Word está en /pdf-to-word y esa página sí sube el archivo. El OCR está en /ocr-pdf. Una imagen de cada página es /pdf-to-jpg.
No hay un tope de páginas publicado. La pestaña tiene que guardar el archivo. Si el navegador no puede conservarlo, la lectura no termina. Esta página no tiene cuenta. El pase de día es $6, se cobra una vez, dura 24 horas y no se renueva. El año es $60 por 365 días. Ninguno de los dos cobros hace falta para leer una capa de texto aquí. El archivo gratis del servidor es una conversión de PDF a Word, hasta 20 páginas, y no es esta página ni el OCR. El OCR no es gratis.
Un archivo vacío, y cualquiera que no se puede abrir, falla con "This PDF could not be read." Un PDF protegido con contraseña falla con "This PDF is protected. Unlock it in this tab first." Esta página no adivina una contraseña. Un PDF sin páginas falla con "This PDF has no pages." Un escaneo sin capa de texto falla con "This PDF has no text layer. A scan needs OCR, which this page does not do." El worker devuelve la cadena. No devuelve un PDF y no llama al OCR.
Pasos
- Suelta el archivo. Se queda en esta pestaña.
- Ajusta la única opción de la página, si la hay.
- Descarga el resultado. Cerrar la pestaña suelta la copia.
Preguntas
¿Qué contiene document.txt?
La capa de texto. Las líneas son líneas de base dentro de 2 unidades, primero lo alto de la página y de izquierda a derecha, unidas por un solo espacio. Las páginas se separan con una línea en blanco. El archivo se llama document.txt. No es un archivo de Word ni un PDF. No se reconstruyen columnas, fuentes ni imágenes. Una segunda columna que comparte la línea de base cae en esa misma línea.
¿PDF a texto sube el archivo?
No. Corre en esta pestaña con los workers de código abierto. El archivo no se sube. No hay copia en GridFS. Al cerrar la pestaña se descarta la copia. PDF a Word en /pdf-to-word es la página que sube el archivo.
¿Dos columnas siguen siendo dos columnas?
No. Las líneas son líneas de base dentro de 2 unidades, de izquierda a derecha. Una segunda columna que comparte la línea de base cae en esa misma línea. No se reconstruyen columnas, fuentes ni imágenes. La descarga es document.txt, no un archivo de Word y no un PDF.
¿Qué pasa si el PDF es un escaneo?
Un escaneo sin capa de texto se rechaza con "This PDF has no text layer. A scan needs OCR, which this page does not do." El OCR es otra página, /ocr-pdf, y es una subida de pago. El pase de día es $6, se cobra una vez, dura 24 horas y no se renueva. El año es $60 por 365 días. El OCR no es gratis. El archivo gratis del servidor es una conversión de PDF a Word, hasta 20 páginas, y no es esta página ni el OCR. Las imágenes de una página están en /pdf-to-jpg, que se queda en esta pestaña y no lee las letras.