PDF → Markdown
把 PDF 裡的字取出來。
變成 Markdown,不是一團亂。
PDF 裡沒有標題 —— 它存的是「在某個座標用某個字體畫這幾個字」。
所以我們靠字級和行距把結構重建出來。哪裡是在猜,會直說。
把檔案拖到這裡。
也可以按按鈕選,或直接 Ctrl+V 貼上。幾十個一起來都行。
.pdf / 單檔 25 MB / 在瀏覽器裡跑,不上傳
別的格式: .docx .doc DOCX → MD · .xlsx Excel → MD · .csv .tsv .txt CSV → MD · .html .htm HTML → MD · .pptx .ppt .odp PPTX → MD
旋鈕
項目符號
分頁標記
怎麼用
- 01把 PDF 拖到上面那個框裡。解析用的是 Mozilla 的 pdf.js,程式庫和字體都由本站自己託管 —— 不從任何 CDN 拉東西。
- 02按頁碼順序逐頁取字。字級決定什麼算標題;行距決定段落在哪裡斷開;貼在頁面上下邊緣的小字當頁首頁尾處理,直接去掉。
- 03想在頁與頁之間留一條 HTML 註解就打開分頁標記。然後複製 Markdown 或者下載 .md。
支援什麼
- 任何帶真文字層的 PDF —— Word、LaTeX、Pages 匯出的,或者瀏覽器列印成的 PDF
- 中日韓文字,靠本站隨附的 CMap 對應表還原
- 靠字級推測的標題,分成三個相對層級
- 靠行首字元認出來的項目和編號清單
- 被印刷排版斷在行尾的單字,會重新接成一個字
- 可選的分頁標記,單一檔案最多 500 頁
做不到什麼
- 掃描版 PDF 什麼都抽不出來。一個字都找不到時,會明確告訴你這大概是掃描檔。
- 不提供 OCR。讀「文字的照片」是另一類工具的事。
- 多欄排版、複雜表格和公式最多算盡力而為
- 加密和設了密碼的 PDF 會被拒絕 —— 這裡沒有輸密碼的地方
- 圖片、顏色和精確定位都留不下,Markdown 裝不住這些
- 超過 25 MB 的檔案,或者超過 500 頁的文件
常有人問
因為裡面沒有字可抽。掃描檔是一頁紙的照片 —— 那些筆畫是像素,不是字元。要讀它得靠 OCR,這個工具不做。與其給你一個沒有解釋的空檔案,不如把原因說清楚。