PDF в текст
Читает текстовый слой и не делает OCR. Работает в этой вкладке. Файл не загружается.
Дневной пропуск за $6 длится 24 часа, списывается один раз и не продлевается. Цены
Этот выбор не загружает рекламный скрипт. Он остаётся в этом браузере.
Что сохраняет этот текст
PDF в текст читает текстовый слой, который уже есть в PDF, и скачивает document.txt. На каждой странице остаются элементы со строкой str и массивом transform. x — это индекс 4 массива transform, y — индекс 5. Элемент, у которого str после обрезки пуст, пропускается. Строки — это базовые линии в пределах 2 единиц: элементы, чьи y отличаются не больше чем на 2, попадают в одну строку. Строки идут по убыванию y, поэтому верх страницы первый. Внутри строки элементы идут по возрастанию x, слева направо, а их str соединяются одним пробелом. Строки одной страницы соединяются переводом строки. Страницы соединяются пустой строкой. Второй столбец с той же базовой линией оказывается на той же строке. Эта страница не восстанавливает столбцы, шрифты или картинки.
Чтение идёт в этой вкладке, открытыми workers. Файл не загружается. Копии в GridFS нет. Закрытие вкладки сбрасывает копию. PDF в Word находится на /pdf-to-word, и та страница загружает файл. OCR находится на /ocr-pdf. Картинка каждой страницы — это /pdf-to-jpg.
Опубликованного предела страниц нет. Вкладка должна удержать файл. Если браузер не может его держать, чтение не закончится. На этой странице нет учётной записи. Дневной пропуск стоит $6, списывается один раз, действует 24 часа и не продлевается. Год стоит $60 и длится 365 дней. Ни одна из плат не нужна, чтобы прочитать текстовый слой здесь. Бесплатный файл сервера — одно преобразование PDF в Word, до 20 страниц, и это не эта страница и не OCR. OCR не бесплатен.
Пустой файл и любой файл, который не открывается, завершается с "This PDF could not be read." PDF с паролем завершается с "This PDF is protected. Unlock it in this tab first." Эта страница не угадывает пароль. PDF без страниц завершается с "This PDF has no pages." Скан без текстового слоя завершается с "This PDF has no text layer. A scan needs OCR, which this page does not do." Worker возвращает строку. Он не возвращает PDF и не вызывает OCR.
Шаги
- Положите файл. Он остаётся в этой вкладке.
- Задайте единственную настройку страницы, если она есть.
- Скачайте результат. Закрытие вкладки сбрасывает копию.
Вопросы
Что внутри document.txt?
Текстовый слой. Строки — это базовые линии в пределах 2 единиц, сначала верх страницы, слева направо, через один пробел. Страницы разделены пустой строкой. Файл называется document.txt. Это не файл Word и не PDF. Столбцы, шрифты и картинки не восстанавливаются. Второй столбец с той же базовой линией оказывается на той же строке.
PDF в текст загружает файл?
Нет. Он работает в этой вкладке с открытыми workers. Файл не загружается. Копии в GridFS нет. Закрытие вкладки сбрасывает копию. Загружает страница PDF в Word на /pdf-to-word.
Два столбца останутся двумя столбцами?
Нет. Строки — это базовые линии в пределах 2 единиц, слева направо. Второй столбец с той же базовой линией оказывается на той же строке. Столбцы, шрифты и картинки не восстанавливаются. Скачивается document.txt, это не файл Word и не PDF.
Что если PDF — это скан?
Скан без текстового слоя отклоняется фразой "This PDF has no text layer. A scan needs OCR, which this page does not do." OCR — другая страница, /ocr-pdf, и это платная загрузка. Дневной пропуск стоит $6, списывается один раз, действует 24 часа и не продлевается. Год стоит $60 и длится 365 дней. OCR не бесплатен. Бесплатный файл сервера — одно преобразование PDF в Word, до 20 страниц, и это не эта страница и не OCR. Картинки страницы — это /pdf-to-jpg: инструмент остаётся в этой вкладке и не читает буквы.