PDF Commons

PDF para texto

Lê a camada de texto e não faz OCR. Roda nesta aba. O arquivo não é enviado.

Um passe de dia de $6 dura 24 horas, cobra-se uma vez e não se renova. Preços

Esta escolha não carrega um script de anúncio. Fica neste navegador.

O que este texto guarda

PDF para texto lê a camada de texto que já está no PDF e baixa document.txt. Cada página guarda os itens que têm uma cadeia str e um array transform. x é o índice 4 de transform e y é o índice 5. Um item cujo str, depois de aparado, fica vazio é ignorado. As linhas são linhas de base dentro de 2 unidades: itens cujos valores de y ficam dentro de 2 partilham uma linha. As linhas são ordenadas por y descendente, por isso o topo da página vem primeiro. Dentro de uma linha, os itens são ordenados por x ascendente, da esquerda para a direita, e os seus str são unidos por um único espaço. As linhas de uma página são unidas por uma quebra de linha. As páginas são unidas por uma linha em branco. Uma segunda coluna que partilha a linha de base cai nessa mesma linha. Esta página não reconstrói colunas, fontes nem imagens.

A leitura corre nesta aba com os workers de código aberto. O arquivo não é enviado. Não há cópia no GridFS. Fechar a aba descarta a cópia. PDF para Word fica em /pdf-to-word e essa página envia o arquivo. O OCR fica em /ocr-pdf. Uma imagem de cada página é /pdf-to-jpg.

Não há um teto de páginas publicado. A aba tem de guardar o arquivo. Se o navegador não conseguir segurá-lo, a leitura não termina. Esta página não tem conta. O passe diário é $6, cobrado uma vez, por 24 horas, e não se renova. O ano é $60 por 365 dias. Nenhuma das duas cobranças é necessária para ler uma camada de texto aqui. O arquivo grátis do servidor é uma conversão de PDF para Word, até 20 páginas, e não é esta página nem o OCR. O OCR não é grátis.

Um arquivo vazio, e qualquer arquivo que não abre, falha com "This PDF could not be read." Um PDF protegido por senha falha com "This PDF is protected. Unlock it in this tab first." Esta página não adivinha uma senha. Um PDF sem páginas falha com "This PDF has no pages." Uma digitalização sem camada de texto falha com "This PDF has no text layer. A scan needs OCR, which this page does not do." O worker devolve a cadeia. Não devolve um PDF e não chama o OCR.

Passos

  1. Largue o ficheiro. Fica neste separador.
  2. Defina a única opção da página, se houver.
  3. Descarregue o resultado. Fechar o separador larga a cópia.

Perguntas

O que contém document.txt?

A camada de texto. As linhas são linhas de base dentro de 2 unidades, o topo da página primeiro, da esquerda para a direita, unidas por um único espaço. As páginas são separadas por uma linha em branco. O arquivo se chama document.txt. Não é um arquivo do Word e não é um PDF. Colunas, fontes e imagens não são reconstruídas. Uma segunda coluna que partilha a linha de base cai nessa mesma linha.

PDF para texto envia o arquivo?

Não. Roda nesta aba com os workers de código aberto. O arquivo não é enviado. Não há cópia no GridFS. Fechar a aba descarta a cópia. PDF para Word em /pdf-to-word é a página que envia.

Duas colunas continuam duas colunas?

Não. As linhas são linhas de base dentro de 2 unidades, da esquerda para a direita. Uma segunda coluna que partilha a linha de base cai nessa mesma linha. Colunas, fontes e imagens não são reconstruídas. O download é document.txt, não um arquivo do Word e não um PDF.

E se o PDF for uma digitalização?

Uma digitalização sem camada de texto é recusada com "This PDF has no text layer. A scan needs OCR, which this page does not do." O OCR é outra página, /ocr-pdf, e é um envio pago. O passe diário é $6, cobrado uma vez, por 24 horas, e não se renova. O ano é $60 por 365 dias. O OCR não é grátis. O arquivo grátis do servidor é uma conversão de PDF para Word, até 20 páginas, e não é esta página nem o OCR. As imagens de uma página são /pdf-to-jpg, que fica nesta aba e não lê as letras.

Também