PDF у текст
Читає текстовий шар і не робить OCR. Працює в цій вкладці. Файл не завантажується.
Денна перепустка за $6 триває 24 години, списується один раз і не поновлюється. Ціни
Цей вибір не вантажить рекламний скрипт. Він лишається в цьому браузері.
Що зберігає цей текст
Інструмент бере шар тексту, який PDF уже містить, і віддає його як document.txt. Це не файл Word і не PDF. На сторінці лишаються лише елементи з рядком str і масивом transform: горизонталь — індекс 4, вертикаль — індекс 5. Якщо після обрізання str порожній, елемент відкидається. Рядок тут — базова лінія в межах 2 одиниць. Елементи, чиї y ближчі ніж на 2, стають одним рядком, а самі рядки йдуть за спаданням y, тобто згори сторінки. Усередині рядка порядок — зростання x, зліва направо, і між str стоїть один пробіл. Рядки сторінки з’єднані переносом, сторінки — порожнім рядком. Друга колонка з тією самою базовою лінією потрапляє в той самий рядок, а не лишається окремою колонкою. Колонки, шрифти й зображення не відтворюються.
Читання відбувається в цій вкладці на відкритих workers. Файл не завантажується. Копії в GridFS немає. Закриття вкладки скидає копію. PDF у Word є на /pdf-to-word, і та сторінка завантажує файл. OCR є на /ocr-pdf. Зображення кожної сторінки — це /pdf-to-jpg.
Опублікованої межі сторінок немає. Вкладка має втримати файл. Якщо браузер не може його втримати, читання не завершиться. На цій сторінці немає облікового запису. Денний перепуст коштує $6, стягується один раз, діє 24 години і не поновлюється. Рік коштує $60 і триває 365 днів. Жодна з плат не потрібна, щоб прочитати текстовий шар тут. Безкоштовний файл сервера — одне перетворення PDF у Word, до 20 сторінок, і це не ця сторінка і не OCR. OCR не безкоштовний.
Порожній файл і будь-який файл, який не відкривається, завершується з "This PDF could not be read." PDF із паролем завершується з "This PDF is protected. Unlock it in this tab first." Ця сторінка не вгадує пароль. PDF без сторінок завершується з "This PDF has no pages." Скан без текстового шару завершується з "This PDF has no text layer. A scan needs OCR, which this page does not do." Worker повертає рядок. Він не повертає PDF і не викликає OCR.
Кроки
- Покладіть файл. Він лишається в цій вкладці.
- Задайте єдине налаштування сторінки, якщо воно є.
- Завантажте результат. Закриття вкладки скидає копію.
Запитання
Що містить document.txt?
Текстовий шар. Рядки — це базові лінії в межах 2 одиниць, спершу верх сторінки, зліва направо, через один пробіл. Сторінки розділені порожнім рядком. Файл називається document.txt. Це не файл Word і не PDF. Колонки, шрифти й зображення не відтворюються. Друга колонка з тією самою базовою лінією потрапляє в той самий рядок.
Чи завантажує PDF у текст файл?
Ні. Він працює в цій вкладці на відкритих workers. Файл не завантажується. Копії в GridFS немає. Закриття вкладки скидає копію. Сторінка, яка завантажує, — це PDF у Word на /pdf-to-word.
Чи лишаються дві колонки двома колонками?
Ні. Рядки — це базові лінії в межах 2 одиниць, зліва направо. Друга колонка з тією самою базовою лінією потрапляє в той самий рядок. Колонки, шрифти й зображення не відтворюються. Завантаження — це document.txt, не файл Word і не PDF.
Що якщо PDF — це скан?
Скан без текстового шару відхиляється фразою "This PDF has no text layer. A scan needs OCR, which this page does not do." OCR — інша сторінка, /ocr-pdf, і це платне вивантаження. Денний перепуст коштує $6, стягується один раз, діє 24 години і не поновлюється. Рік коштує $60 і триває 365 днів. OCR не безкоштовний. Безкоштовний файл сервера — одне перетворення PDF у Word, до 20 сторінок, і це не ця сторінка і не OCR. Зображення сторінки — це /pdf-to-jpg: інструмент лишається в цій вкладці і не читає літери.