PDF 轉 Word

PDF 裡沒有段落。它裡面只有一個個字元,各自記著自己畫在頁面上的哪個位置——段落、標題和閱讀順序在產生這個檔的那一刻就丟掉了。這個頁面把那些位置讀回來,再把結構猜出來:共用同一條基線的字元併成一行,行距夠近的幾行併成一段,字級明顯比正文大的當成標題。一般的單欄文件做得不錯,排成格子的東西就做不好。每次跑完它會告訴你你這份是哪一種。

  • 不上傳
  • 不用註冊
  • 無浮水印
  • 不限檔案數
把檔案拖到這裡或點擊選擇不限大小、不限數量——只受你自己電腦記憶體限制。

你的檔案

一般單欄文件做得最好。表格、多欄版面和用圖畫出來的東西沒辦法原樣保住——跑完底下那幾行會說你這份的情況。

只有完全沒有文字的頁面才會送去 OCR。第一次用會下載辨識引擎(約 15 MB),一頁要好幾秒,出來的是純文字,沒有標題也沒有粗體。

預設不保留,所以跨兩頁的段落會被接回去。需要 Word 檔跟 PDF 一樣分頁時再打開。

    還沒選檔案。

    你的檔案去了哪裡

    哪裡都沒去。這個網頁會下載一小段程式到你的瀏覽器,由它直接讀取你硬碟上的檔案。程式本身來自本站,就像圖片或樣式表一樣——但你的檔案只會從硬碟走到你自己的瀏覽器分頁裡。

    為什麼用這個

    那些大型轉檔站給不了你的東西。

    還原的是段落,不是一行一段

    常見的免費轉檔工具是一行印出來的字給你一個 Word 段落,於是每句話都在 PDF 剛好換行的地方被切斷,你什麼都重排不了。這裡會把行接回去——包括行尾用連字號斷開的單字——只有在行距、縮排、字級或粗細真的變了的地方才起新的一段。

    標題是真的 Word 標題

    比正文大的字級會按大小排名,對應到「標題 1」「標題 2」「標題 3」,所以功能窗格會列出大綱,「插入 → 目錄」也抓得到。粗體和斜體取自那一段字元當初用的字體,不是看字形去猜。

    重複的頁眉頁腳和頁碼會拿掉

    同一句話出現在四十頁的頁首,那不是四十段內容。落在上下邊界、又在半數以上的頁面重複出現的行,以及單獨的頁碼,會被移除——移除了幾行會報給你,你才判斷得出它有沒有拿掉不該拿的東西。

    做不到的地方它會講

    多欄版面、看起來像表格列的行、裁不出來的圖片、側著印的文字、整頁沒有文字的掃描頁,每一項都會算數量、寫清楚原因,就放在下載鈕底下。要不要把這份檔寄出去,由你看完再決定。

    怎麼用

    選一個或多個 PDF。裡面有掃描件的話,先把 OCR 那個勾打上。

    按開始。每一頁要讀兩遍——一遍讀文字,一遍算版面——所以長文件會跑一陣子。

    下載 .docx,然後把按鈕底下那幾行說明看完,那裡寫著哪些東西沒轉過去。

    什麼時候會用到

    只想改別人那份 PDF 裡的兩段話

    要沿用供應商的條款、合約裡的某一條、報告裡的某一節。你要的是能改的字,不是一張頁面的圖。

    不想整篇重打一遍

    提案、文章或手冊只剩 PDF 一種格式,而正文得挪到一個你動得了的地方。

    這個檔不能傳給不認識的伺服器

    合約、診斷書、薪資單,還有簽了保密協議的東西。其他轉檔網站一律要先把檔案傳上去才肯動。

    常見問題

    轉出來會跟 PDF 長得一樣嗎?

    不會,也沒往那個方向做。這不是一個複製版面的工具。它把文字按閱讀順序放回去、套 Word 自己的樣式,紙張大小跟原檔一樣,邊界取自文字實際落在哪裡。換行位置、原本的字體、字距、分欄,還有用向量畫出來的東西,都不會重現。要一模一樣的外觀,你需要的就是那份 PDF。

    表格會怎麼樣?

    不會變成 Word 表格。PDF 裡根本沒有「表格」這件事,只有一格格剛好對齊的文字。當一行中間有很寬的空隙時,那些空隙會變成定位字元(Tab),這一行自己成一段,所以資料一個不少、順序也對。想要真的表格,在 Word 裡把那幾行選起來,用「插入 → 表格 → 文字轉換為表格」,分隔符號選「定位點」。報告裡會寫有幾行是這樣出來的。

    雙欄的頁面呢?

    做法是找一條從上到下沒有任何一行跨過去的空白竖帶,找到就把每一欄各自由上往下讀完再讀下一欄——那正是正確的閱讀順序,而且會報給你讓你自己核對。三欄也是同樣做法。會壞掉的是欄位在頁面中途才開始或結束、或者側欄壓到正文的版面,那種會交錯在一起,你一眼就看得出來。

    我的 PDF 是掃描的,轉出來是空的。

    掃描頁就是一張紙的照片。裡面沒有字元可以讀,也就沒有東西可以轉。把「用 OCR 讀掃描頁」勾起來,那些頁會改用辨識的方式處理——但這裡的 OCR 只有英文,一頁要好幾秒,而且回來的是純文字,沒有標題也沒有粗體。如果你的掃描件不是英文,這個工具幫不了你,調什麼設定都一樣。

    粗體斜體準嗎?

    它取自那一段字元當初用的字體,所以只要原檔用的是真正的粗體或斜體字型就會是對的,而這是大多數情況。不準的情況是:PDF 用「把輪廓描兩次」偽造粗體,或者把一個正體字斜著畫而我們沒認出來。底線、文字顏色和螢光標示則完全不會帶過去。

    可以一次轉很多個檔嗎?

    可以,一個 PDF 出一個 .docx。超過三個會打包成一個 zip,因為瀏覽器會擋掉連續觸發的下載,不打包的話你會莫名少掉幾個檔。超過 2 GB 的 PDF 根本打不開——瀏覽器沒辦法一次讀進那麼大的檔,那是瀏覽器的限制,不是我們設的規矩。

    我的檔案會被上傳嗎?

    不會。PDF 是這個頁面直接從你的磁碟讀的,Word 檔在這個分頁裡組出來,下載也是從你自己的瀏覽器出去的。你可以一邊開著網路面板一邊看它跑。PDF 解析器和 OCR 引擎第一次用的時候會從本站下載,跟任何一段腳本一樣——你的文件不在裡面。

    其他工具