PDF เป็น TXT

แปลง PDF เป็น TXT ออนไลน์ฟรี แยกข้อความจาก PDF และแปลงเป็นไฟล์ข้อความธรรมดา รักษาย่อหน้าและการขึ้นบรรทัดใหม่ เหมาะสำหรับประมวลผลเนื้อหาข้อความ แยกคำพูดหรือเตรียมสำหรับวิเคราะห์

คำแนะนำที่เกี่ยวข้อง

PDF เป็น TXT คืออะไร?

การแปลง PDF เป็น TXT คือการอ่าน text layer ที่มีอยู่แล้วในไฟล์ PDF แล้วส่งออกเป็น plain text (.txt) โดยตรง เครื่องมือนี้ทำงานทั้งหมดในเบราว์เซอร์ด้วย Mozilla pdf.js และไม่อัปโหลดไฟล์ขึ้นเซิร์ฟเวอร์ ไม่มี OCR ในตัว จึงเหมาะกับ PDF ที่มีข้อความจริง แต่ไม่เหมาะกับไฟล์สแกนหรือ PDF ที่เป็นภาพล้วน

เหมาะเมื่อคุณต้องการคัดลอกข้อความจาก PDF อย่างรวดเร็ว ค้นหาเนื้อหาด้วย grep หรือสคริปต์ ส่งข้อความไปให้ AI สรุปหรือแปล หรือเตรียมข้อมูลข้อความที่ค้นหาได้

ต่างจาก PDF เป็น Word หรือ PDF เป็น HTML ที่พยายามเก็บ layout ไว้ PDF เป็น TXT จะเก็บเฉพาะเนื้อหาข้อความ ทำให้ไฟล์เบาและเหมาะกับงานค้นหา งานอัตโนมัติ และการประมวลผลต่อมากกว่า

กรณีการใช้งาน

  • แยกข้อความจาก PDF เพื่อแก้ไขในโปรแกรมแก้ไขข้อความใด ๆ โดยไม่มีรูปแบบ
  • แปลงเอกสาร PDF เป็นข้อความธรรมดาเพื่อประมวลผลด้วยเครื่องมือวิเคราะห์ข้อความ
  • เมื่อต้องคัดลอกเนื้อหาจาก PDF โดยไม่คัดลอกดีไซน์หรือรูปภาพ
  • แยกคำพูด ข้อมูลอ้างอิงหรือส่วนข้อความจาก PDF เพื่อใช้ซ้ำ

วิธีการใช้งาน

  1. อัปโหลดไฟล์ PDF ที่ต้องการแยกข้อความ
  2. เริ่มการแปลงและแยกข้อความจาก PDF
  3. ยืนยันว่าย่อหน้าและการขึ้นบรรทัดใหม่ได้รับการรักษาอย่างถูกต้อง
  4. ดาวน์โหลดไฟล์ TXT และดำเนินการแก้ไขหรือประมวลผล

คุณสมบัติ

  • ข้อความสะอาดไม่มีรูปแบบ: ลบภาพและเลย์เอาต์ออก เหลือแต่ข้อความล้วนที่แก้ไขง่าย
  • จัดรูปแบบยืดหยุ่น: เก็บการขึ้นบรรทัดใหม่ บีบอัดช่องว่าง เพิ่มตัวแบ่งหน้า
  • ควบคุมทีละหน้า: แยกข้อความเฉพาะหน้าที่คุณต้องการ
  • ดูตัวอย่างและคัดลอกเร็ว: ดูผลออนไลน์ คัดลอกหรือดาวน์โหลดด้วยคลิกเดียว

PDF เป็น TXT, Word, HTML หรือ Excel ควรเลือกแบบไหน?

รูปแบบผลลัพธ์ที่เหมาะสมขึ้นอยู่กับว่าคุณจะนำเนื้อหาจาก PDF ไปใช้อะไรต่อ

เป้าหมายของคุณตัวเลือกที่แนะนำเหตุผล
ต้องการข้อความล้วนสำหรับค้นหา เขียนสคริปต์ หรือป้อน AIใช้ PDF เป็น TXTไม่มี formatting รบกวน ไฟล์เล็ก และเหมาะกับการประมวลผลข้อความเต็มรูปแบบPDF เป็น TXT
ต้องการแก้ไขหัวข้อ ย่อหน้า และรายการต่อใน Wordใช้ PDF เป็น WordWord เก็บโครงสร้างเอกสารและ layout พื้นฐานได้ดีกว่าPDF เป็น Word
ต้องการเผยแพร่บนเว็บหรือเก็บลิงก์ไว้ใช้ PDF เป็น HTMLHTML เหมาะกับการนำไปใช้บนเว็บและคงโครงสร้างเนื้อหาPDF เป็น HTML
เนื้อหาใน PDF ส่วนใหญ่เป็นตารางใช้ PDF เป็น ExcelTXT ไม่สามารถเก็บความสัมพันธ์ของแถวและคอลัมน์ได้PDF เป็น Excel
ไฟล์ PDF เป็นสแกนหรือภาพล้วนเครื่องมือนี้ดึงข้อความโดยตรงไม่ได้ต้องใช้ OCR ก่อน เพราะเครื่องมือนี้อ่านได้เฉพาะ text layer ที่มีอยู่แล้ว

Best Practices

ตรวจสอบก่อนว่าเป็น PDF แบบข้อความหรือไฟล์สแกน

ถ้าผลลัพธ์ว่างหรือมีตัวอักษรน้อยมาก ไฟล์นั้นอาจไม่มี text layer ให้ดึง

เอกสารหลายคอลัมน์ควรลองทั้งเปิดและปิดการเก็บบรรทัด

ใน layout ซับซ้อน ลำดับข้อความภายในอาจไม่ตรงกับลำดับการอ่านบนหน้าจอ ลองเปรียบเทียบทั้งสองแบบ

ถ้ามีตารางจำนวนมาก ให้ใช้ PDF เป็น Excel

การดึงเป็นข้อความล้วนจะทำให้ข้อมูลตารางไหลรวมกัน หากต้องการแถวและคอลัมน์ให้ใช้ /pdf/to-excel/

PDF เป็น Excel

ถ้าเอกสารยาว ให้จำกัดช่วงหน้าก่อน

หากต้องการเพียงบางส่วนของเอกสาร การดึงเฉพาะหน้าที่ต้องการจะช่วยให้ค้นหาและประมวลผลง่ายขึ้น

แยกหน้า PDF

เปิดไฟล์ TXT ด้วย UTF-8

หากอักษรภาษาไทยหรือภาษาอื่นแสดงเพี้ยน ให้ตรวจสอบว่าโปรแกรมเปิดไฟล์ใช้ UTF-8

คำถามที่พบบ่อย

การขึ้นบรรทัดใหม่จะถูกเก็บไว้ตอนแยกข้อความไหม?

ได้ คุณสามารถเลือกเก็บการขึ้นบรรทัดใหม่ บีบอัดช่องว่างส่วนเกิน หรือเพิ่มตัวแบ่งหน้าเพื่อให้รู้ว่าแต่ละส่วนมาจากหน้าไหน

แยกข้อความจากบางหน้าได้ไหม?

ได้ ระบุหน้าที่ต้องการ แล้วระบบจะแยกข้อความจากหน้านั้นๆ เท่านั้น เหมาะมากถ้าอยากได้แค่บางส่วนโดยไม่ต้องประมวลผลทั้งเอกสาร

ข้อความที่แยกออกมาจะมีตัวอักษรแปลกๆ ไหม?

ไฟล์ TXT จะถูกสร้างเป็น UTF-8 หากยังเห็นตัวอักษรเพี้ยน ให้ตรวจสอบก่อนว่าโปรแกรมเปิดไฟล์ด้วย UTF-8 และหากยังมีปัญหา สาเหตุอาจมาจากฟอนต์หรือการแมปอักขระใน PDF ต้นฉบับ

คัดลอกข้อความได้ไหมโดยไม่ต้องดาวน์โหลดไฟล์?

ได้! หลังแยกข้อความคุณสามารถดูตัวอย่างและคัดลอกข้อความได้ทันทีด้วยคลิกเดียว ถ้าอยากเก็บไว้ก็ดาวน์โหลดเป็นไฟล์ TXT ได้เช่นกัน

การแก้ไขปัญหา

ผลลัพธ์ว่างหรือมีข้อความน้อยมาก

ไฟล์อาจเป็น PDF แบบสแกนหรือภาพล้วน จึงไม่มี text layer ที่ดึงออกมาได้

การขึ้นบรรทัดหรือเรียงข้อความดูแปลก

ในเอกสารหลายคอลัมน์ ลำดับข้อความภายในอาจไม่ตรงกับลำดับการอ่านบนจอ ลองสลับตัวเลือกการเก็บบรรทัดแล้วเปรียบเทียบผล

ตารางกลายเป็นข้อความยาวต่อกัน

เครื่องมือนี้ไม่รู้จำโครงสร้างตาราง หากต้องการรักษาตารางไว้ควรใช้ /pdf/to-excel/

ใส่รหัสผ่านแล้วแต่ยังเปิดไม่ได้

ตรวจสอบอีกครั้งว่ารหัสผ่านถูกต้องและไม่มีช่องว่างเกิน หากยังไม่ได้ ไฟล์อาจเสียหายหรือใช้รูปแบบการเข้ารหัสที่ยังไม่รองรับ

ไฟล์ TXT เปิดแล้วอักษรเพี้ยน

ให้เปิดไฟล์ด้วย UTF-8 บางโปรแกรมอาจเดา encoding ผิดและแสดงผลภาษาไทยผิดพลาด

อภิธานศัพท์

Text layer ของ PDF
ข้อมูลข้อความที่เก็บอยู่ภายใน PDF และสามารถ parse ได้โดยตรง PDF จาก Word หรือเว็บมักมีชั้นข้อความนี้ แต่ไฟล์สแกนมักไม่มี
UTF-8 encoding
ชุดรหัสอักขระสากลที่รองรับแทบทุกภาษา ไฟล์ .txt จากเครื่องมือนี้ใช้ UTF-8 เป็นค่าเริ่มต้น
ช่วงหน้าที่กำหนดเอง
ดึงเฉพาะหน้าที่ต้องการ เช่น 1-3,5,8-10 แทนการดึงทั้งเอกสาร
PDF ที่เข้ารหัส
PDF ที่มีรหัสผ่านเปิดไฟล์ ต้องใส่รหัสผ่านให้ถูกก่อนจึงจะดึงข้อความได้

4 ตัวเลือกผลลัพธ์ที่ใช้บ่อย

คุณสามารถใช้แยกกันหรือผสมกันตามความต้องการได้

ตัวเลือกผลลัพธ์เหมาะกับกรณี
เก็บการขึ้นบรรทัดใหม่รักษาโครงสร้างบรรทัดจาก PDF ให้ใกล้เคียงต้นฉบับเมื่ออยากได้ผลลัพธ์ใกล้ต้นฉบับ
รวมช่องว่างส่วนเกินลบช่องว่างเกินและบรรทัดว่างสำหรับค้นหาข้อความหรือใช้กับสคริปต์
เพิ่มตัวคั่นหน้าเพิ่ม marker ก่อนข้อความของแต่ละหน้าเมื่ออยากรู้ว่าข้อความมาจากหน้าไหน
กำหนดช่วงหน้าเองดึงเฉพาะหน้าที่เลือกเมื่อเอกสารยาวแต่ต้องการแค่บางส่วน

ขอบเขตความสามารถของ PDF เป็น TXT

ควรรู้ก่อนว่าเครื่องมือนี้ทำอะไรได้และอะไรที่ยังไม่รองรับ

รายการรองรับหมายเหตุ
ดึงข้อความจาก PDF ที่มี text layerรองรับประมวลผลในเบราว์เซอร์และเสร็จเร็ว
PDF เข้ารหัสที่ทราบรหัสผ่านรองรับใส่รหัสผ่านถูกต้องแล้วจึงดึงข้อความได้
รู้จำข้อความจากไฟล์สแกน / ไฟล์ภาพไม่รองรับไม่มี OCR ในตัว
คงโครงสร้างตารางไม่รองรับควรใช้ /pdf/to-excel/
ประมวลผลหลาย PDF พร้อมกันไม่รองรับตอนนี้รองรับทีละ 1 ไฟล์

5 งานที่มักทำต่อหลังแปลงเป็น TXT

ข้อความที่ดึงออกมาแล้วสามารถนำไปใช้ต่อกับ AI การค้นหา สคริปต์ และงานวิเคราะห์ได้

สถานการณ์ใช้งานเครื่องมือที่ใช้ต่อคุณค่าหลัก
สรุปด้วย AI / Q&AGPT / Claudeส่งเนื้อหา PDF เข้าโมเดลโดยตรง
ค้นหาข้อความทั้งเอกสารgrep / ripgrepหา keyword ได้เร็ว
งานแปลจำนวนมากDeepL / Googleแปลข้อความจาก PDF ยาว ๆ เป็นชุด
ประมวลผลด้วยโปรแกรมPython / Nodeนำข้อความไปใช้กับสคริปต์ต่อได้ง่าย
เตรียม corpusExcel / ฐานข้อมูลจัดระเบียบข้อความสำหรับวิเคราะห์หรือฝึกโมเดล

Authoritative References