PDF Commons

PDF у текст

Читає текстовий шар і не робить OCR. Працює в цій вкладці. Файл не завантажується.

Денна перепустка за $6 триває 24 години, списується один раз і не поновлюється. Ціни

Цей вибір не вантажить рекламний скрипт. Він лишається в цьому браузері.

Що зберігає цей текст

Інструмент бере шар тексту, який PDF уже містить, і віддає його як document.txt. Це не файл Word і не PDF. На сторінці лишаються лише елементи з рядком str і масивом transform: горизонталь — індекс 4, вертикаль — індекс 5. Якщо після обрізання str порожній, елемент відкидається. Рядок тут — базова лінія в межах 2 одиниць. Елементи, чиї y ближчі ніж на 2, стають одним рядком, а самі рядки йдуть за спаданням y, тобто згори сторінки. Усередині рядка порядок — зростання x, зліва направо, і між str стоїть один пробіл. Рядки сторінки з’єднані переносом, сторінки — порожнім рядком. Друга колонка з тією самою базовою лінією потрапляє в той самий рядок, а не лишається окремою колонкою. Колонки, шрифти й зображення не відтворюються.

Читання відбувається в цій вкладці на відкритих workers. Файл не завантажується. Копії в GridFS немає. Закриття вкладки скидає копію. PDF у Word є на /pdf-to-word, і та сторінка завантажує файл. OCR є на /ocr-pdf. Зображення кожної сторінки — це /pdf-to-jpg.

Опублікованої межі сторінок немає. Вкладка має втримати файл. Якщо браузер не може його втримати, читання не завершиться. На цій сторінці немає облікового запису. Денний перепуст коштує $6, стягується один раз, діє 24 години і не поновлюється. Рік коштує $60 і триває 365 днів. Жодна з плат не потрібна, щоб прочитати текстовий шар тут. Безкоштовний файл сервера — одне перетворення PDF у Word, до 20 сторінок, і це не ця сторінка і не OCR. OCR не безкоштовний.

Порожній файл і будь-який файл, який не відкривається, завершується з "This PDF could not be read." PDF із паролем завершується з "This PDF is protected. Unlock it in this tab first." Ця сторінка не вгадує пароль. PDF без сторінок завершується з "This PDF has no pages." Скан без текстового шару завершується з "This PDF has no text layer. A scan needs OCR, which this page does not do." Worker повертає рядок. Він не повертає PDF і не викликає OCR.

Кроки

  1. Покладіть файл. Він лишається в цій вкладці.
  2. Задайте єдине налаштування сторінки, якщо воно є.
  3. Завантажте результат. Закриття вкладки скидає копію.

Запитання

Що містить document.txt?

Текстовий шар. Рядки — це базові лінії в межах 2 одиниць, спершу верх сторінки, зліва направо, через один пробіл. Сторінки розділені порожнім рядком. Файл називається document.txt. Це не файл Word і не PDF. Колонки, шрифти й зображення не відтворюються. Друга колонка з тією самою базовою лінією потрапляє в той самий рядок.

Чи завантажує PDF у текст файл?

Ні. Він працює в цій вкладці на відкритих workers. Файл не завантажується. Копії в GridFS немає. Закриття вкладки скидає копію. Сторінка, яка завантажує, — це PDF у Word на /pdf-to-word.

Чи лишаються дві колонки двома колонками?

Ні. Рядки — це базові лінії в межах 2 одиниць, зліва направо. Друга колонка з тією самою базовою лінією потрапляє в той самий рядок. Колонки, шрифти й зображення не відтворюються. Завантаження — це document.txt, не файл Word і не PDF.

Що якщо PDF — це скан?

Скан без текстового шару відхиляється фразою "This PDF has no text layer. A scan needs OCR, which this page does not do." OCR — інша сторінка, /ocr-pdf, і це платне вивантаження. Денний перепуст коштує $6, стягується один раз, діє 24 години і не поновлюється. Рік коштує $60 і триває 365 днів. OCR не безкоштовний. Безкоштовний файл сервера — одне перетворення PDF у Word, до 20 сторінок, і це не ця сторінка і не OCR. Зображення сторінки — це /pdf-to-jpg: інструмент лишається в цій вкладці і не читає літери.

Також