OCR ของ PDF
ไฟล์นี้จะถูกอัปโหลด ไฟล์ถูกลบภายใน 30 นาที เครื่องมือในเครื่องไม่อ่านรูปของข้อความ ไฟล์เซิร์ฟเวอร์ฟรีคือ PDF เป็น Word OCR ต้องใช้บัตรรายวัน $6 หรือรายปี $60
ขั้นตอน
- วางไฟล์สแกน หน้านี้จะอ่านรูปของข้อความ ไม่ได้แปลง PDF ที่มีข้อความเลือกได้อยู่แล้วเป็น Word
- ใส่อีเมลที่ใช้ตอนชำระ OCR ไม่ใช่ไฟล์เซิร์ฟเวอร์ฟรี
- ดาวน์โหลด PDF สำเนาบนเซิร์ฟเวอร์ถูกลบภายใน 30 นาที
คำถาม
ไฟล์ถูกอัปโหลดหรือไม่
ใช่ เครื่องมือในเบราว์เซอร์ไม่ถูกอัปโหลด OCR เก็บไฟล์สแกนและผลลัพธ์ใน GridFS จนกว่างานเก็บรักษาจะลบทั้งคู่
บัตรรายวันต่ออายุเองหรือไม่
ไม่ ราคา $6 เรียกเก็บครั้งเดียว และสิ้นสุดหลัง 24 ชั่วโมง รายปีคือ $60 เราจะส่งอีเมลก่อนการเรียกเก็บนั้น 7 วัน การชำระทั้งสองอยู่ที่หน้าราคา ราคา
การอ่านนี้คืนอะไร
เซิร์ฟเวอร์เปลี่ยนทุกหน้าเป็น PNG ที่ 200 จุดต่อนิ้ว แล้วขอให้ Tesseract ทำชั้นข้อความภาษาอังกฤษ ธงภาษาคือ eng ไม่มีเมนูภาษา pdftoppm ทำงานครั้งเดียว ด้วย -png, -r 200 และช่วงจาก 1 ถึงจำนวนหน้า Tesseract ทำงานครั้งเดียวต่อหน้า และเขียน PDF ของหน้านั้น หน้าเดียวถูกคืนเป็น PDF นั้น มากกว่าหนึ่งหน้าถูกผสานตามลำดับ ชื่อดาวน์โหลดเป็น ocr.pdf เสมอ มันเป็น PDF ไม่ใช่ไฟล์เวิร์ด ไฟล์เดิมบนคอมพิวเตอร์ไม่ถูกแทนที่
ภาพสแกนและ ocr.pdf เข้า MongoDB GridFS ที่ bucket uploads ด้วย tool ocr-pdf ต้นฉบับใช้ role source ผลใช้ role result PNG งานอยู่ในไดเรกทอรีชั่วคราว และถูกลบเมื่องานจบหรือล้ม งานคงข้อมูลลบอ็อบเจกต์ GridFS ที่เวลาอัปโหลดอย่างน้อย RETENTION_MINUTES ค่าที่หาย ศูนย์ หรือไม่เป็นบวกใช้ 30 แถว deletions เก็บ id ชื่อ เครื่องมือ บทบาท เวลาอัปโหลด และเวลาลบ ไม่เก็บไบต์ แถว เซิร์ฟเวอร์ลบภาพสแกนและ ocr.pdf ภายใน 30 นาที
ไม่มีไฟล์ OCR ฟรี ประตูถูกเรียกโดยนับไฟล์ฟรีไว้ที่ 1 แล้ว ดังนั้นผู้มาเยือนที่ไม่มีการซื้อที่ทำงานถูกปฏิเสธ เพดานคือ 20 หน้า แม้พาสกำลังทำงาน พาสวันละ $6 เรียกเก็บครั้งเดียว 24 ชั่วโมง และไม่ต่ออายุ ปีละ $60 และอยู่ 365 วัน อีเมลต้องตรงกับการซื้อที่ status เป็น active ตั้งแต่ต้นจนก่อนจบ ไฟล์ฟรีของเซิร์ฟเวอร์คือ PDF เป็น Word หนึ่งไฟล์ สูงสุด 20 หน้า บนหน้าของมัน pdftoppm และ Tesseract ของแต่ละหน้าถูกหยุดหลัง 60 วินาที ฟอร์มรับไฟล์เดียว
ไม่มีไฟล์ หรือไม่มี %PDF- ใน 1024 อักขระแรก ล้มด้วย "Choose a PDF." ไฟล์ที่อ่านจำนวนหน้าไม่ได้ล้มด้วย "This PDF could not be read." ไม่มีหน้าล้มด้วย "This PDF has no pages." เกิน 20 หน้าล้มด้วย "OCR stops at 20 pages." ไม่มีพาสล้มด้วย "OCR needs a $6 day pass or the $60 year. The free server file is PDF to Word. Enter the email from checkout." ถ้าไม่มี pdftoppm หรือ Tesseract หน้านี้บอก "OCR is not available on this server." กระบวนการหมดเวลาหรือล้มก็จบเป็น "This PDF could not be read."
คำถาม
ใน ocr.pdf มีอะไร
เป็น PDF Tesseract เขียนชั้นข้อความภาษาอังกฤษจากภาพ 200 DPI ของแต่ละหน้า หน้านี้ไม่สร้างคอลัมน์ใหม่ และไม่ออก .docx PDF ที่มีข้อความเลือกได้อยู่แล้วก็ยังเดินทางภาพเดียวกัน PDF เป็น Word คือหน้าที่คัดลอกชั้นข้อความที่มีอยู่ไปยังเวิร์ด
สแกนครั้งแรกฟรีหรือไม่
ไม่ฟรี OCR ของ PDF ไม่เคยเป็นไฟล์ฟรีของเซิร์ฟเวอร์ ไฟล์ฟรีคือการแปลง PDF เป็น Word หนึ่งครั้ง สูงสุด 20 หน้า เมื่อ PDF นั้นมีข้อความที่เลือกได้ หน้านี้ขออีเมลชำระเงินของพาสที่ทำงานก่อนอ่านภาพสแกน
หลังลบแล้วเหลืออะไร
GridFS เอาภาพสแกนและ ocr.pdf ออกหลังนาฬิกาคงข้อมูล 30 นาที เว้นแต่ RETENTION_MINUTES เป็นจำนวนบวก แถว deletions เก็บ id และเวลา ไม่เก็บไบต์ แถว jobs เก็บชื่อ จำนวนหน้า อีเมลที่พิมพ์ และแฮชเครือข่าย PNG ชั่วคราวหายไปแล้ว
พาสเปลี่ยนอะไรที่หน้านี้
ต้องมีพาสที่ทำงานก่อนสแกนครั้งแรก พาสวันละ $6 เรียกเก็บครั้งเดียว เป็นเวลา 24 ชั่วโมง และไม่ต่ออายุ ปีละ $60 เป็นเวลา 365 วัน การยกเลิกหยุดการเรียกเก็บปีถัดไป เพดาน 20 หน้ายังอยู่ทั้งสองแบบ พาสไม่เพิ่มภาษาอื่นนอกจากอังกฤษ และไม่เปลี่ยนผลเป็นเวิร์ด