PDF Commons

PDF เป็นข้อความ

อ่านชั้นข้อความ และไม่ทำ OCR ทำงานในแท็บนี้ ไฟล์ไม่ถูกอัปโหลด

บัตรรายวัน $6 ใช้ได้ 24 ชั่วโมง เรียกเก็บครั้งเดียว และไม่ต่ออายุ ราคา

ตัวเลือกนี้ไม่โหลดสคริปต์โฆษณา และคงอยู่ในเบราว์เซอร์นี้

ข้อความนี้เก็บอะไรไว้

PDF เป็นข้อความอ่านชั้นข้อความที่มีอยู่แล้วใน PDF แล้วดาวน์โหลด document.txt แต่ละหน้าเก็บรายการที่มีสตริง str และอาร์เรย์ transform x คือดัชนี 4 ของ transform และ y คือดัชนี 5 รายการที่ str หลังตัดช่องว่างแล้วว่างจะถูกข้าม บรรทัดคือเส้นฐานภายใน 2 หน่วย รายการที่ค่า y อยู่ภายใน 2 จะอยู่บรรทัดเดียวกัน บรรทัดเรียงตาม y จากมากไปน้อย ดังนั้นด้านบนของหน้ามาก่อน ในบรรทัด รายการเรียงตาม x จากน้อยไปมาก จากซ้ายไปขวา และ str ต่อด้วยช่องว่างเดียว บรรทัดของหนึ่งหน้าต่อด้วยขึ้นบรรทัดใหม่ หน้าต่อด้วยบรรทัดว่าง คอลัมน์ที่สองที่ใช้เส้นฐานเดียวกันจะตกอยู่บรรทัดเดียวกัน หน้านี้ไม่สร้างคอลัมน์ แบบอักษร หรือรูปขึ้นใหม่

การอ่านทำงานในแท็บนี้ด้วย workers โอเพนซอร์ส ไฟล์ไม่ถูกอัปโหลด ไม่มีสำเนาใน GridFS การปิดแท็บทิ้งสำเนา PDF เป็น Word อยู่ที่ /pdf-to-word และหน้านั้นอัปโหลด OCR อยู่ที่ /ocr-pdf รูปของแต่ละหน้าคือ /pdf-to-jpg

ไม่มีเพดานหน้าประกาศไว้ แท็บต้องถือไฟล์ไว้ ถ้าเบราว์เซอร์เก็บ PDF ไม่ได้ การอ่านจะไม่จบ หน้านี้ไม่มีบัญชี บัตรรายวันคือ $6 คิดครั้งเดียว นาน 24 ชั่วโมง และไม่ต่ออายุ ปีคือ $60 สำหรับ 365 วัน ไม่มีค่าใช้จ่ายใดในสองอย่างที่ต้องใช้เพื่ออ่านชั้นข้อความที่นี่ ไฟล์เซิร์ฟเวอร์ฟรีคือการแปลง PDF เป็น Word หนึ่งครั้ง สูงสุด 20 หน้า และไม่ใช่หน้านี้และไม่ใช่ OCR OCR ไม่ฟรี

ไฟล์ว่าง และไฟล์ใดที่เปิดไม่ได้ จะล้มเหลวด้วย "This PDF could not be read." PDF ที่มีรหัสผ่านจะล้มเหลวด้วย "This PDF is protected. Unlock it in this tab first." หน้านี้ไม่เดารหัสผ่าน PDF ที่ไม่มีหน้าจะล้มเหลวด้วย "This PDF has no pages." สแกนที่ไม่มีชั้นข้อความจะล้มเหลวด้วย "This PDF has no text layer. A scan needs OCR, which this page does not do." worker คืนสตริง ไม่คืน PDF และไม่เรียก OCR

ขั้นตอน

  1. วางไฟล์ ไฟล์อยู่ในแท็บนี้
  2. ตั้งค่าตัวเลือกเดียวของหน้า ถ้ามี
  3. ดาวน์โหลดผลลัพธ์ ปิดแท็บแล้วสำเนาจะหาย

คำถาม

document.txt มีอะไรอยู่

ชั้นข้อความ บรรทัดคือเส้นฐานภายใน 2 หน่วย ด้านบนของหน้ามาก่อน จากซ้ายไปขวา ต่อด้วยช่องว่างเดียว หน้าคั่นด้วยบรรทัดว่าง ไฟล์ชื่อ document.txt ไม่ใช่ไฟล์ Word และไม่ใช่ PDF ไม่สร้างคอลัมน์ แบบอักษร หรือรูปขึ้นใหม่ คอลัมน์ที่สองที่ใช้เส้นฐานเดียวกันจะตกอยู่บรรทัดเดียวกัน

PDF เป็นข้อความอัปโหลดไฟล์หรือไม่

ไม่อัปโหลด ทำงานในแท็บนี้ด้วย workers โอเพนซอร์ส ไฟล์ไม่ถูกอัปโหลด ไม่มีสำเนาใน GridFS การปิดแท็บทิ้งสำเนา หน้าที่อัปโหลดคือ PDF เป็น Word ที่ /pdf-to-word

สองคอลัมน์จะยังเป็นสองคอลัมน์หรือไม่

ไม่ บรรทัดคือเส้นฐานภายใน 2 หน่วย จากซ้ายไปขวา คอลัมน์ที่สองที่ใช้เส้นฐานเดียวกันจะตกอยู่บรรทัดเดียวกัน ไม่สร้างคอลัมน์ แบบอักษร หรือรูปขึ้นใหม่ ไฟล์ที่ดาวน์โหลดคือ document.txt ไม่ใช่ไฟล์ Word และไม่ใช่ PDF

ถ้า PDF เป็นสแกนจะเป็นอย่างไร

สแกนที่ไม่มีชั้นข้อความจะถูกปฏิเสธด้วย "This PDF has no text layer. A scan needs OCR, which this page does not do." OCR เป็นอีกหน้า คือ /ocr-pdf และเป็นการอัปโหลดที่ต้องจ่าย บัตรรายวันคือ $6 คิดครั้งเดียว นาน 24 ชั่วโมง และไม่ต่ออายุ ปีคือ $60 สำหรับ 365 วัน OCR ไม่ฟรี ไฟล์เซิร์ฟเวอร์ฟรีคือการแปลง PDF เป็น Word หนึ่งครั้ง สูงสุด 20 หน้า และไม่ใช่หน้านี้และไม่ใช่ OCR รูปของหน้าคือ /pdf-to-jpg ซึ่งอยู่ในแท็บนี้และไม่อ่านตัวอักษร

อีกด้วย