PDF → Markdown
把 PDF 里的字取出来。
变成 Markdown,不是一团乱。
PDF 里没有标题 —— 它存的是「在某个坐标用某个字体画这几个字」。
所以我们靠字号和行距把结构重建出来。哪里是在猜,会直说。
把文件拖到这儿。
也可以点按钮选,或者直接 Ctrl+V 粘。几十个一起来都行。
.pdf / 单个 25 MB / 在浏览器里跑,不上传
别的格式: .docx .doc DOCX → MD · .xlsx Excel → MD · .csv .tsv .txt CSV → MD · .html .htm HTML → MD · .pptx .ppt .odp PPTX → MD
旋钮
项目符号
分页标记
怎么用
- 01把 PDF 拖到上面那个框里。解析用的是 Mozilla 的 pdf.js,库和字体都由本站自己托管 —— 不从任何 CDN 拉东西。
- 02按页码顺序逐页取字。字号决定什么算标题;行间距决定段落在哪里断开;贴在页面上下边缘的小字当页眉页脚处理,直接去掉。
- 03想在页与页之间留一条 HTML 注释就打开分页标记。然后复制 Markdown 或者下载 .md。
支持什么
- 任何带真文字层的 PDF —— Word、LaTeX、Pages 导出的,或者浏览器打印成的 PDF
- 中日韩文字,靠本站随附的 CMap 映射表还原
- 靠字号推测的标题,分成三个相对层级
- 靠行首字符认出来的无序和有序列表
- 被印刷排版断在行尾的单词,会重新接成一个词
- 可选的分页标记,单个文件最多 500 页
做不到什么
- 扫描版 PDF 什么都抽不出来。一个字都找不到时,会明确告诉你这大概是扫描件。
- 不提供 OCR。读「文字的照片」是另一类工具的事。
- 多栏排版、复杂表格和公式最多算尽力而为
- 加密和设了密码的 PDF 会被拒绝 —— 这儿没有输密码的地方
- 图片、颜色和精确定位都留不下,Markdown 装不住这些
- 超过 25 MB 的文件,或者超过 500 页的文档
常有人问
因为里面没有字可抽。扫描件是一页纸的照片 —— 那些笔画是像素,不是字符。要读它得靠 OCR,这个工具不做。与其给你一个没有解释的空文件,不如把原因说清楚。