PDF към текст
Чете текстовия слой и не прави OCR. Работи в този раздел. Файлът не се качва.
Дневен пропуск за $6 трае 24 часа, удържа се веднъж и не се подновява. Цени
Този избор не зарежда рекламен скрипт. Остава в този браузър.
Какво запазва този текст
PDF в текст чете текстовия слой, който вече е в PDF, и сваля document.txt. Всяка страница пази елементите, които имат низ str и масив transform. x е индекс 4 на transform, а y е индекс 5. Елемент, чийто str след изрязване е празен, се пропуска. Редовете са базови линии в рамките на 2 единици: елементите, чиито y са в рамките на 2, споделят един ред. Редовете се подреждат по y низходящо, така че горната част на страницата е първа. В реда елементите се подреждат по x възходящо, отляво надясно, а str се съединяват с един интервал. Редовете на една страница се съединяват с нов ред. Страниците се съединяват с празен ред. Втора колона, която споделя базовата линия, попада на същия ред. Тази страница не възстановява колони, шрифтове или картини.
Четенето тече в този раздел с отворените workers. Файлът не се качва. Няма копие в GridFS. Затварянето на раздела маха копието. PDF в Word е на /pdf-to-word и онази страница качва файла. OCR е на /ocr-pdf. Картина на всяка страница е /pdf-to-jpg.
Няма публикуван таван на страниците. Разделът трябва да държи файла. Ако браузърът не може да го задържи, четенето не завършва. Тази страница няма профил. Дневният пропуск е $6, таксува се веднъж, за 24 часа, и не се подновява. Годината е $60 за 365 дни. Нито една от двете такси не е нужна, за да се чете текстов слой тук. Безплатният сървърен файл е едно преобразуване от PDF в Word, до 20 страници, и не е тази страница и не е OCR. OCR не е безплатен.
Празен файл и всеки файл, който не се отваря, се проваля с "This PDF could not be read." PDF с парола се проваля с "This PDF is protected. Unlock it in this tab first." Тази страница не познава парола. PDF без страници се проваля с "This PDF has no pages." Сканиране без текстов слой се проваля с "This PDF has no text layer. A scan needs OCR, which this page does not do." Worker връща низа. Не връща PDF и не вика OCR.
Стъпки
- Пуснете файла. Той остава в този раздел.
- Задайте единствената настройка на страницата, ако има такава.
- Изтеглете резултата. Затварянето на раздела маха копието.
Въпроси
Какво има в document.txt?
Текстовият слой. Редовете са базови линии в рамките на 2 единици, първо горната част на страницата, отляво надясно, с един интервал. Страниците се разделят с празен ред. Файлът се казва document.txt. Не е файл на Word и не е PDF. Колони, шрифтове и картини не се възстановяват. Втора колона, която споделя базовата линия, попада на същия ред.
PDF в текст качва ли файла?
Не. Работи в този раздел с отворените workers. Файлът не се качва. Няма копие в GridFS. Затварянето на раздела маха копието. Страницата, която качва, е PDF в Word на /pdf-to-word.
Две колони остават ли две колони?
Не. Редовете са базови линии в рамките на 2 единици, отляво надясно. Втора колона, която споделя базовата линия, попада на същия ред. Колони, шрифтове и картини не се възстановяват. Свалянето е document.txt, не файл на Word и не PDF.
А ако PDF е сканиране?
Сканиране без текстов слой се отказва с "This PDF has no text layer. A scan needs OCR, which this page does not do." OCR е друга страница, /ocr-pdf, и е платено качване. Дневният пропуск е $6, таксува се веднъж, за 24 часа, и не се подновява. Годината е $60 за 365 дни. OCR не е безплатен. Безплатният сървърен файл е едно преобразуване от PDF в Word, до 20 страници, и не е тази страница и не е OCR. Картините на страница са /pdf-to-jpg, което остава в този раздел и не чете буквите.