PDF 轉 TXT

線上擷取 PDF 文字為 TXT,瀏覽器本機處理不上傳,支援加密 PDF 與自訂頁碼範圍,免費使用,處理後可立即下載。

相關推薦

什麼是 PDF 轉 TXT?

PDF 轉 TXT 是把 PDF 內部既有的文字層直接解析並匯出為純文字(.txt)的操作,本工具基於 Mozilla pdf.js 在瀏覽器本機完成,不會上傳伺服器。它解析的是 PDF 已經存在的文字層,不包含 OCR 圖像文字辨識,所以只對「文字型 PDF」(如 Word / 網頁 / 各類辦公軟體匯出的 PDF)有效;掃描檔、截圖或圖片拼接而成的 PDF 通常沒有文字層,無法用本工具擷取出文字。

**應用場景:** ① 快速複製 PDF 中的文字內容;② 用 grep / awk 等命令列工具搜尋和處理 PDF 內容;③ 把 PDF 文字內容餵給 AI 大型語言模型做摘要、翻譯或問答;④ 學術研究、資料整理時準備可檢索、可編輯的純文字語料。

**和 PDF 轉 Word / HTML 的差異:** PDF 轉 Word、PDF 轉 HTML 會盡量保留標題、段落、超連結等版面資訊,適合直接編輯或發布;PDF 轉 TXT 只保留文字內容本身,去除全部樣式,檔案體積更小,更適合程式化處理和全文檢索。

適用場景

  • 快速複製 PDF 中的文字內容,不用再逐段手動選取
  • 只需要文件中某幾頁內容時,用自訂頁碼範圍單獨擷取
  • 把 PDF 文字內容餵給 AI 大型語言模型、翻譯工具或摘要工具做進一步處理
  • 用 grep / awk 等命令列工具搜尋和處理 PDF 轉換出的文字內容
  • 學術研究、資料整理時準備可檢索、可編輯的純文字語料
  • 合約、報告等帶密碼保護的 PDF 需要先解鎖再擷取文字內容

使用方法

  1. 上傳需要擷取文字的 PDF 檔案;如果檔案已加密,先在密碼欄輸入密碼解鎖
  2. 依需求勾選自訂頁碼範圍、保留換行、合併多餘空白、加入分頁分隔線等選項
  3. 點擊開始擷取,瀏覽器本機處理,幾秒內即可在預覽區看到結果
  4. 複製文字,或下載 .txt 檔案

功能特點

  • 瀏覽器本機處理:PDF 文字擷取全程在裝置本機完成,不上傳伺服器
  • 保留原始換行:依 PDF 內部換行位置還原文字行結構,而不是強行拼成一整段
  • 合併多餘空白:一鍵去除多餘空格與連續空行,輸出更整潔的文字
  • 按頁插入分隔線:可選擇在每頁文字前加入頁碼分隔標記,方便定位內容來源頁
  • 支援自訂頁碼範圍:可以只擷取指定頁面,不需要處理整份文件
  • 支援加密 PDF:輸入密碼即可解鎖受密碼保護的 PDF 並擷取文字
  • 結果可複製或下載:擷取完成後可直接複製到剪貼簿,或下載為 UTF-8 編碼的 .txt 檔案

PDF 轉 TXT、轉 Word、轉 HTML、轉 Excel,該選哪個?

同一份 PDF,後續用途不同,匯出的格式也應該不同。先確定你要拿這份內容做什麼,再決定用哪個工具。

你的目標更合適的做法為什麼
只要純文字內容,做檢索、腳本處理或餵給大型語言模型用目前這個 PDF 轉 TXT輸出沒有樣式干擾,檔案體積最小,最適合程式化處理和全文檢索。PDF 轉 TXT
要在 Word 裡繼續編輯標題、段落和清單改用 PDF 轉 WordPDF 轉 Word 會盡量保留版面和段落結構,適合直接修改後重新排版。PDF 轉 Word
要發布到網頁,或需要保留超連結、圖文混排改用 PDF 轉 HTMLHTML 輸出保留基本網頁結構,適合直接嵌入網站或部落格。PDF 轉 HTML
PDF 裡主要是表格資料,需要繼續統計或計算改用 PDF 轉 ExcelTXT 不會辨識表格結構,表格內容會混在一起;轉 Excel 才能保留行列關係。PDF 轉 Excel
PDF 是掃描檔或圖片,沒有可擷取的文字層本工具無法直接擷取本工具解析的是 PDF 內部已有的文字層,不包含 OCR 圖像文字辨識,掃描檔、圖片型 PDF 需要先用 OCR 工具辨識出文字,再來處理純文字。

最佳实践

先確認 PDF 是文字型還是掃描檔

本工具基於 PDF 內部已有的文字層直接解析,不會做 OCR 辨識。可以先嘗試擷取一次,如果結果是空的或只有極少字元,代表這份 PDF 很可能是掃描檔或圖片拼接而成的。

多欄或藝術排版建議比較兩種換行設定

複雜多欄、海報式排版的 PDF,文字在內容流中的順序可能和視覺閱讀順序不完全一致。可以分別勾選、不勾選「保留換行」比較效果,選擇更接近原文的結果。

表格內容請改用 PDF 轉 Excel,不要用 TXT 硬擷取

純文字擷取不會辨識表格結構,表格內容會按字元順序混在一起。需要保留行列關係時,請直接使用 PDF 轉 Excel。

PDF 轉 Excel

頁數很多但只需要部分內容時,先依頁碼範圍縮小擷取範圍

本頁面一次只處理一個檔案。如果 PDF 頁數很多、只需要其中幾頁,建議先用自訂頁碼範圍只擷取需要的頁面,減少無關內容干擾後續處理,也可以先用擷取頁面工具單獨拆出來。

擷取 PDF 頁面

下載後確認編碼是否為 UTF-8

少數編輯器可能把 txt 另存為 ANSI/GBK 等編碼,導致中文顯示亂碼。用 VSCode、Notepad++ 或系統預設編輯器開啟時確認編碼為 UTF-8,可以避免這個問題。

常見問題

PDF 轉 TXT 會保留原本的格式嗎?

不會。TXT 是純文字格式,不會保留字型、顏色、粗體、斜體等樣式。如需保留版面請使用 /pdf/to-word/ 或 /pdf/to-html/。本工具可以保留原始換行,讓文字行結構更接近原文。

掃描檔或圖片型 PDF 能擷取出文字嗎?

不能。本工具直接解析 PDF 內部已有的文字層,不包含 OCR 圖像文字辨識。掃描檔、截圖或圖片拼接而成的 PDF 通常沒有文字層,擷取結果會是空的或只有極少字元。

擷取出來的文字順序會錯亂嗎?

順序基本上依照 PDF 內容流的原始排列輸出,多數常規排版的文字型 PDF 會得到正常閱讀順序。但複雜多欄、海報式或部分工具產生的特殊排版 PDF,順序可能和視覺閱讀順序不完全一致,可以嘗試切換「保留換行」選項比較效果。

中文或其他語言擷取後亂碼怎麼辦?

請先檢查 TXT 是否以 UTF-8 編碼開啟。如果編碼正確仍然亂碼,通常是 PDF 本身沒有正確嵌入對應文字的字型或對照表,這種情況下文字層本身可能已經缺失或錯誤,暫時無法透過本工具修復。

支援帶密碼的 PDF 嗎?

支援。在密碼欄輸入正確密碼即可解鎖並擷取文字。如果忘記密碼,本工具不提供密碼破解功能,無法擷取。

PDF 轉 TXT 安全嗎?會上傳伺服器嗎?

不會上傳。擷取全程在瀏覽器本機完成,檔案不會離開你的裝置,也沒有需要上傳到伺服器辨識的環節。

可以一次擷取多個 PDF 檔案嗎?

目前一次只能處理一個檔案。如果需要處理多份 PDF,請逐一上傳擷取。

PDF 中的表格擷取後會是什麼樣子?

本工具的純文字擷取不會辨識表格結構,會按字元順序輸出,同一表格的內容會混在一起。如需保留行列關係,請使用 /pdf/to-excel/。

PDF 檔案大小有限制嗎?

單一 PDF 檔案最大支援 50MB。超出限制可以先用 /pdf/compress/ 壓縮檔案體積,或用 /pdf/extract-pages/ 只保留需要的頁面後再擷取。

故障排查

擷取結果是空的,或只有極少文字

代表這份 PDF 很可能是掃描檔或圖片拼接而成的,沒有可擷取的文字層。本工具不包含 OCR 圖像文字辨識,暫時無法處理這類 PDF。

擷取出來的文字換行混亂

PDF 在窄欄或多欄版面下,內容流順序可能和視覺閱讀順序不完全一致。可以嘗試切換「保留換行」選項,比較哪種結果更接近原文。

PDF 中的表格被辨識成一團字元

本工具不會對表格做結構辨識,輸出的是純文字流。如需表格結構,請使用 /pdf/to-excel/。

輸入密碼後仍然提示無法解鎖

請確認密碼輸入無誤、沒有多餘空格。如果密碼確實正確仍然失敗,可能是檔案本身已損壞,或使用了本工具暫不支援的加密方式。

TXT 編碼不對(中文亂碼)

請確保 TXT 檔案以 UTF-8 編碼開啟:① Windows 可用 Notepad++ / VSCode 切換為 UTF-8;② macOS / Linux 預設 UTF-8;③ 檢查是否在其他編輯器中被另存為 ANSI/GBK 編碼。

術語表

PDF 文字層
PDF 檔案內部保存的可直接解析的文字資料。有文字層的 PDF(如 Word、網頁、辦公軟體匯出)可以被直接擷取;掃描檔和圖片拼接而成的 PDF 通常沒有文字層。
UTF-8 編碼
通用字元編碼,相容中、英、日、韓等幾乎所有語言文字。本工具輸出的 .txt 檔案預設使用 UTF-8 編碼。
自訂頁碼範圍
只擷取部分頁面而非整份文件,支援單頁、連續區間和多段組合,例如 1-3,5,8-10。
加密 PDF
設定了開啟密碼的 PDF 檔案。擷取文字前需要輸入正確密碼解鎖,本工具不提供密碼破解功能。

4 種輸出選項組合

依需求勾選合適的輸出選項,可以組合使用。

選項效果典型場景
保留換行依 PDF 內部換行位置還原文字行希望文字行結構更接近原文
合併多餘空白去除多餘空格與連續空行全文檢索 / grep 處理
加入分頁分隔線每頁文字前插入頁碼分隔標記需要定位內容來源頁
自訂頁碼範圍只擷取指定頁面長文件只需要部分內容

PDF 轉 TXT 的能力邊界

先了解本工具能做什麼、不能做什麼,避免用錯場景。

內容是否支援說明
文字型 PDF 擷取文字支援瀏覽器本機解析,幾秒完成
加密 PDF(已知密碼)支援輸入密碼後正常解鎖擷取
掃描檔 / 圖片型 PDF 辨識文字不支援無 OCR 能力,需先用 OCR 工具辨識
表格結構保留不支援請改用 /pdf/to-excel/
一次處理多個 PDF不支援目前一次只處理一個檔案

5 種常見 PDF 轉 TXT 後續處理場景

把 TXT 文字內容應用到大型語言模型、Shell 腳本、搜尋索引等場景。

使用場景後續處理工具核心價值
AI 摘要 / 問答GPT / ClaudePDF 內容餵給大型語言模型
全文搜尋grep / ripgrep命令列快速定位關鍵字
翻譯匯入DeepL / Google批次翻譯大量 PDF 內容
程式讀取Python / Node對 PDF 文字內容做進一步處理
語料準備Excel / 資料庫整理成訓練或分析用的語料

Authoritative References