PDF Commons

PDF का OCR

यह फ़ाइल अपलोड होगी। यह 30 मिनट के अंदर मिटती है। स्थानीय उपकरण पाठ की तस्वीरें नहीं पढ़ते। मुफ़्त सर्वर फ़ाइल PDF से Word है। OCR के लिए $6 का दिन पास या $60 का वर्ष चाहिए।

पास चेकआउट ईमेल से मिलता है। समाप्ति समय सक्रिय विंडो है।

कदम

  1. एक स्कैन छोड़ें। यह पृष्ठ पाठ की तस्वीरें पढ़ता है। जो PDF पहले से चुना जा सकने वाला पाठ रखता है, उसे Word में नहीं बदलता।
  2. भुगतान में इस्तेमाल किया ईमेल लिखें। OCR मुफ़्त सर्वर फ़ाइल नहीं है।
  3. PDF डाउनलोड करें। सर्वर की प्रति 30 मिनट के अंदर मिटती है।

सवाल

क्या फ़ाइल अपलोड होती है?

हाँ। ब्राउज़र उपकरण नहीं। OCR स्कैन और परिणाम को GridFS में रखता है जब तक प्रतिधारण दोनों को मिटा न दे।

क्या दिन पास अपने आप आगे बढ़ता है?

नहीं। यह $6 है, एक बार लिया जाता है, और 24 घंटे बाद खत्म होता है। वर्ष $60 है। उस शुल्क से 7 दिन पहले हम ईमेल करते हैं। दोनों भुगतान कीमत वाले पृष्ठ पर हैं। मूल्य

यह पठन क्या लौटाता है

सर्वर हर पृष्ठ को 200 बिंदु प्रति इंच का PNG बनाता है, फिर Tesseract से अंग्रेज़ी पाठ परत माँगता है। भाषा ध्वज eng है। भाषा मेनू नहीं है। pdftoppm एक बार चलता है, -png, -r 200, और 1 से पृष्ठ संख्या तक की सीमा के साथ। Tesseract हर पृष्ठ पर एक बार चलता है और उस पृष्ठ का PDF लिखता है। एक पृष्ठ उसी PDF के रूप में लौटता है। एक से अधिक पृष्ठ क्रम में जुड़ते हैं। डाउनलोड नाम हमेशा ocr.pdf है। यह PDF है, Word फ़ाइल नहीं। कंप्यूटर पर मूल फ़ाइल बदली नहीं जाती।

स्कैन और ocr.pdf दोनों MongoDB GridFS में जाते हैं, बकेट uploads, tool ocr-pdf के साथ। स्रोत role source का उपयोग करता है। परिणाम role result का उपयोग करता है। काम के PNG अस्थायी निर्देशिका में रहते हैं और काम खत्म या असफल होने पर हट जाते हैं। प्रतिधारण उन GridFS वस्तुओं को मिटाता है जिनका अपलोड समय कम से कम RETENTION_MINUTES पुराना हो। अनुपस्थित, शून्य या धनात्मक न होने वाला मान 30 का उपयोग करता है। deletions पंक्ति फ़ाइल id, नाम, औज़ार, भूमिका, अपलोड समय और मिटाने का समय रखती है, बाइट नहीं। सर्वर स्कैन और ocr.pdf को 30 मिनट के अंदर मिटा देता है।

कोई मुफ़्त OCR फ़ाइल नहीं है। द्वार को मुफ़्त फ़ाइल गिनती पहले से 1 रखकर बुलाया जाता है, इसलिए सक्रिय खरीद के बिना आगंतुक अस्वीकृत होता है। सीमा 20 पृष्ठ है, पास सक्रिय हो तब भी। दिन पास $6 है, एक बार शुल्क, 24 घंटे, और नवीनीकृत नहीं होता। वर्ष $60 है और 365 दिन चलता है। ईमेल ऐसी खरीद से मेल खाना चाहिए जिसका status active हो, आरंभ से अंत से पहले तक। मुफ़्त सर्वर फ़ाइल PDF से Word है, एक फ़ाइल, अधिकतम 20 पृष्ठ, अपने पृष्ठ पर। pdftoppm और हर पृष्ठ का Tesseract 60 सेकंड बाद बंद हो जाता है। फ़ॉर्म एक फ़ाइल लेता है।

कोई फ़ाइल नहीं, या पहले 1024 अक्षरों में %PDF- नहीं, तो विफलता "Choose a PDF." है। जिस फ़ाइल की पृष्ठ संख्या न पढ़ी जा सके वह "This PDF could not be read." देती है। कोई पृष्ठ नहीं तो "This PDF has no pages."। 20 पृष्ठ से अधिक पर "OCR stops at 20 pages."। बिना पास "OCR needs a $6 day pass or the $60 year. The free server file is PDF to Word. Enter the email from checkout."। यदि pdftoppm या Tesseract स्थापित नहीं है तो पृष्ठ कहता है "OCR is not available on this server." समय समाप्त या असफल प्रक्रिया भी "This PDF could not be read." पर समाप्त होती है।

सवाल

ocr.pdf के अंदर क्या है?

एक PDF। Tesseract हर पृष्ठ की 200 DPI तस्वीर से अंग्रेज़ी पाठ परत लिखता है। यह पृष्ठ स्तंभ दोबारा नहीं बनाता और .docx नहीं देता। जिस PDF में पहले से चयन योग्य पाठ हो वह भी उसी चित्र मार्ग से जाता है। PDF से Word वह पृष्ठ है जो मौजूद पाठ परत को Word में कॉपी करता है।

क्या पहला स्कैन मुफ़्त है?

नहीं। PDF का OCR कभी मुफ़्त सर्वर फ़ाइल नहीं होता। मुफ़्त फ़ाइल एक PDF से Word रूपांतर है, अधिकतम 20 पृष्ठ, जब उस PDF में चयन योग्य पाठ हो। यह पृष्ठ स्कैन पढ़ने से पहले सक्रिय पास का चेकआउट ईमेल माँगता है।

मिटाने के बाद क्या रहता है?

GridFS घड़ी के बाद स्कैन और ocr.pdf हटाता है, 30 मिनट जब तक RETENTION_MINUTES धनात्मक संख्या न हो। deletions पंक्ति id और समय रखती है, बाइट नहीं। jobs पंक्ति नाम, पृष्ठ संख्या, टाइप किया ईमेल और नेटवर्क हैश रखती है। अस्थायी PNG पहले ही जा चुके हैं।

पास यहाँ क्या बदलता है?

पहले स्कैन से पहले सक्रिय पास ज़रूरी है। दिन पास $6 है, एक बार शुल्क, 24 घंटे के लिए, और नवीनीकृत नहीं होता। वर्ष $60 है 365 दिनों के लिए। रद्द करना अगला वार्षिक शुल्क रोकता है। 20 पृष्ठ की सीमा दोनों पर रहती है। पास अंग्रेज़ी के अलावा भाषा नहीं जोड़ता और परिणाम को Word नहीं बनाता।

और भी