從 PDF 複製文字並將其貼上到 Word 或文字編輯器中通常會產生混亂的斷線。 PDF 中的每一行都會成為貼上輸出中的一個單獨段落,並且帶有硬換行符,導致文字無法作為連續散文進行編輯。在PDF 到 Word 轉換或複製後刪除這些不需要的換行符是一項格式清理任務,可以透過尋找和替換以及一些鍵盤快捷鍵來自動化。
要點
PDF 文字擷取在每條視覺線的末尾放置一個硬換行符。當貼到文字編輯器時,每一行都成為一個單獨的段落。最快的修復方法是使用通配符進行查找和替換,刪除單換行符,同時保留真正段落之間的雙換行符。這個單一操作可以在幾秒鐘內將破碎的文字轉換成流暢的段落。

為什麼 PDF 文字複製時有這麼多的換行符
PDF 將文字儲存為單獨的線條對象,每個對象位於頁面上的特定座標。與文字從一行連續流到下一行的文字處理文件不同,PDF 沒有流動文字的概念。每條線都是一個單獨的物件。當您複製文字時,提取過程會按順序讀取這些行對象,並在每個對象後面放置一個換行符,因為它無法區分結束段落的換行符和僅在段落內換行的換行符。
對於多列 PDF 和從格式化文字文件建立的 PDF,此問題最為明顯。 PDF 中跨越四個視線的段落在貼上時會變成四個單獨的段落,每個段落都以段落標記結尾。編輯此文字需要手動將各行重新連接在一起,這對於多個段落而言非常乏味。尋找和取代方法可以自動重新連線。
嘗試 PDF 轉 Word
無需安裝。直接在您的瀏覽器中工作。
透過尋找和取代刪除單行中斷
使用尋找和取代連接斷線後,掃描文字以尋找本應保留但未保留的段落分隔符號。項目符號和編號清單是最常見的傷亡,因為每個項目符號或編號都獨佔一行。尋找和取代方法將它們連接成一個段落。手動恢復每個項目符號或數字之前的換行符。此清理步驟需要幾分鐘,但會產生精美的最終文件。
将复制的文本粘贴到 Word 中。使用 Ctrl+H 打开“查找并替换”。在「尋找內容」欄位中,鍵入 ^p 以符合段落標記。在替换为字段中,键入一个空格。单击全部替换。文件中的每個段落標記都替換為空格,將所有文字連接成一個段落。這太激進了,因為它也刪除了真正段落之間的段落標記。若要解決此問題,請先保護分隔實際段落的雙段落標記。首先將 ^p^p 替換為 @@PARA@@ 等佔位符。然後將剩餘的單一 ^p 標記替換為空格。最後,將 @@PARA@@ 替換為 ^p^p 以恢復段落分隔符號。
通配符查找和替換方法可以擴展以處理更複雜的清理模式。可以透過在刪除常規換行符之前使用佔位符替換標題文字模式(例如以冒號結尾的行,後跟段落標記)來保護具有節標題的文件。連接正文文字行後,從佔位符號恢復標題分隔符號。這保留了段落結構和標題分隔。
在 Word 中,這個三步驟過程大約需要 30 秒,適用於任何長度的文字。關鍵是使用不在文件文字中任何位置出現的佔位符。 After replacing single line breaks, the text flows as continuous paragraphs. Each original paragraph break is preserved as a double line break.該文件現在可以像普通散文一樣進行編輯。 WukongPDF 的PDF 格式 工具在轉換過程中保留段落結構,減少複製後所需的手動換行清理量。
使用線上文本清理工具進行快速修復
一鍵清理可以節省幾分鐘的手動逐行編輯時間。
對於從經過 OCR 處理的掃描 PDF 複製的文本,OCR 錯誤會加劇換行問題。每個錯誤識別的字元都會為已經損壞的文字增加噪音。在這種情況下,請在刪除換行符後透過拼字檢查器運行文字。拼字檢查器可以捕捉換行符號刪除無法解決的 OCR 錯誤。換行符號刪除和拼字檢查的結合可以從掃描文件中產生最乾淨的輸出。
一些免費的線上工具專門用於清理從 PDF 複製的文字。將複製的文字貼上到工具中,它會自動刪除單行分隔符,同時保留段落分隔符。這些工具使用與手動尋找和取代方法相同的邏輯,但只需單擊即可應用。它們非常適合一次性文字清理任務,在這些任務中,在 Word 中設定查找和替換比該任務所需的工作量更大。
選擇線上文字清理工具時,請注意您正在將潛在敏感文字貼到第三方網站中。對於機密文檔,請在本機應用程式中使用手動查找和取代方法,而不是線上工具。手動方法可以離線工作,將文字保存在電腦上,並產生相同的結果。
防止未來副本中出現換行問題
文字擷取的品質也取決於 PDF 的建立方式。文字處理器產生的 PDF 通常比透過掃描和 OCR 建立的 PDF 具有更好的內部文字排序。文字處理器產生的 PDF 中的文字順序遵循原始文件的閱讀順序。 OCR 產生的 PDF 中的文字順序遵循 OCR 引擎識別文字的空間順序,這可能與多列或複雜佈局中的閱讀順序不符。
如果您經常需要從 PDF 複製文本,請調整您的工作流程以最大程度地減少清理負擔。在複製文字之前將 PDF 轉換為 Word,而不是直接從 PDF 檢視器複製。 PDF 到 Word 轉換工具旨在處理換行符連接並產生流暢的文字。轉換後的 Word 文件仍需要一些清理,但遠遠少於直接從 PDF 檢視器複製的文字。
若要建立其他人需要從中複製文字的 PDF,請在 PDF 建立過程中啟用輔助使用標記。標籤的 PDF 包含告訴文字擷取工具段落開始和結束位置的結構資訊。從標籤的 PDF 複製的文字比從未標籤的 PDF 複製的文字要清晰得多,因為提取工具使用段落結構標籤,而不是根據行位置猜測段落邊界。
從 Word 產生 PDF 時,請在 PDF 匯出設定中啟用「文件結構標記以實現輔助功能」選項。這會將結構資訊嵌入 PDF 中,文字擷取工具可使用該資訊來識別段落邊界。從標籤的 PDF 中提取的文字的虛假換行次數明顯減少,因為提取工具從結構標籤中了解段落的開始和結束位置,而不是根據行位置進行猜測。
常見問題
原始 PDF 中使用的字體是否會影響文字副本的清晰程度?是的,顯著。使用標準 PostScript 或 TrueType 字型以及適當編碼的 PDF 比使用自訂編碼字型的 PDF 複製得更乾淨。某些自訂字體使用非標準字元映射,其中顯示為字母 A 的內容在內部儲存為完全不同的字元代碼。當您從此類 PDF 複製文字時,提取的文字可能包含完全錯誤的字元。除了基於 OCR 的提取之外,沒有其他方法可以解決字體編碼問題。
為什麼從 PDF 貼上的文字有時會在單字中間插入隨機空格?這稱為文字碎片,當 PDF 將單一字元或一小組字元儲存為單獨的文字物件時,就會發生這種情況。 PDF 檢視器在文字擷取期間在物件之間插入空格。沒有自動修復。唯一的解決辦法就是人工校對。使用正確的字體嵌入和文字編碼建立的 PDF 不太可能出現碎片。
有沒有一種方法可以從 PDF 複製文字而不出現任何換行符?一些 PDF 到文字擷取工具會根據設計產生連續的段落。這些工具分析文字佈局並連接屬於同一段落的行。輸出比複製貼上更乾淨,但需要使用提取工具而不是標準的選擇和複製方法。對於頻繁的文字擷取,投資專用的擷取工具可以節省大量的清理時間。
為什麼貼上的 PDF 文字有時會在單字中間有多餘的空格?
當 PDF 將每個字元或一小群字元儲存為單獨的文字物件且它們之間有很小的間隙時,就會發生這種情況。文字擷取過程會在每個間隙處插入一個空格。沒有對此進行自動修復,因為這些空格與合法的單字空格無法區分。手動校對和修正是唯一的解決辦法。建立具有正確字體嵌入的 PDF 可以減少字元級文字碎片的發生。
我可以從 PDF 表格複製文字而不破壞列對齊嗎?
標準複製貼上不保留表結構。所有列中的文字均按閱讀順序提取,從而產生混亂的序列。若要複製保留列的表數據,請使用可偵測表結構的 PDF 到 Excel 轉換工具。 Excel 輸出保留列對齊方式,您可以從 Excel 複製,結構保持不變。
PDF 檢視器會影響文字複製的清晰程度嗎?
是的。 Adobe Acrobat 的文字擷取通常是最乾淨的。基於瀏覽器的檢視器通常會產生更多換行符,因為它們針對顯示而不是文字擷取進行了最佳化。如果您需要經常複製文本,請使用專用的 PDF 閱讀器進行提取,而不是基於瀏覽器的檢視器。
嘗試 PDF 轉 Word
無需安裝。直接在您的瀏覽器中工作。
