PDF转MD在线工具:扫描版PDF也能转出干净的Markdown
PDF怎么转成Markdown?扫描版PDF也能转吗?
把PDF转成Markdown,工具首先要看懂文档的结构:哪一行是标题,哪几行组成列表,表格的行和列在哪里,然后再用Markdown语法写出来。大多数PDF转Markdown工具依赖文件里存储的文字层。这对电子版PDF没问题,但扫描版PDF的每一页其实只是一张图片,只读文字层的工具就会返回一个空文件,或者几个零散的字符。Linnk读取的是页面图像本身:AI模型(Linnk使用ChatGPT、Claude和Gemini模型)逐页识别,把页面重建为结构化文本,再据此生成Markdown文件,所以扫描件、手机照片和电子版PDF都按同样的方式转换。标题、列表和表格都会保留,表格以Markdown表格呈现。数字、编号、日期和金额逐位照录;看不清的数字用问号标出,无法辨认的段落标为 [illegible],不做猜测。文档默认保持原来的语言。同一次转换还能拿到纯文本和可搜索PDF,也可以按需生成Word文件。平整、清晰、光线充足的页面通常效果最好;字迹较淡或纸张卷曲的扫描件,可能需要快速核对一下。
Last updated: 2026年9月
PDF转MD只需三步
扫描版或电子版PDF,三步就能变成.md文件。
上传PDF或照片
拖入一份PDF(扫描版、电子版都可以),或一张JPG、PNG、WEBP、HEIC格式的页面照片。照片按单页扫描件读取。Markdown已默认选中,输出语言设为“保留原语言”。
查看预览
转换通常每页不到一分钟,一般的扫描件大约半分钟,处理时页面会显示预计时间。复制识别出的文字是免费的。留意问号和 [illegible],它们标出了页面上看不清的地方。
下载Markdown文件
登录免费账号即可下载.md文件。纯文本和可搜索PDF由同一次转换生成;如果还需要Word文件,也可以申请生成,需要多等几分钟。
这款PDF转MD工具能做什么
专为要再次利用的文字设计:提示词、笔记、文档和网站都用得上。
扫描件也能转,不只是电子版PDF
只读文字层的转换工具,要求PDF里本来就存着文字。扫描的合同、复印的书页或拍下来的纸质讲义里并没有文字,这类工具自然转不出内容。Linnk读取的是页面图像,所以扫描件和照片能像电子版文件一样顺利转换。
标题、列表和表格保留为结构
章节标题变成Markdown标题,项目符号和编号变成列表,表格转成Markdown表格,可以直接粘贴进README或笔记。结构是按页面实际呈现的样子重建的,而不是按PDF内部碰巧存放文字的顺序。
数字照录,不靠猜
版本号、日期、金额和编号逐位照录。淡得看不清的数字用问号标出,无法辨认的段落标为 [illegible],读者和下游模型都不会拿到一个看似确定的猜测。
适合大模型和RAG的Markdown
Markdown简洁紧凑,标题又为分块(chunking)提供了天然的切分点,所以常被用作大模型提示词和检索流程的输入。PDF转Markdown只需做一次,之后就能把结果贴进对话、按标题切分或建立索引。
保留原语言,或顺便翻译
可以保留原来的语言,也可以在同一次转换中翻译。日文手册默认仍是日文,阿拉伯文、希伯来文、中文和韩文文档同样能读取,生成的Markdown与你要引用的原文一致。
一次上传,多种格式
同一次转换会提供纯文本,以及用真实文字重建的可搜索PDF,还可以按需生成Word文件。如果文档里有表格,同一次转换还能下载电子表格和CSV文件。
PDF转MD转换须知
上传PDF、扫描件或照片之前,先了解能得到什么。
输入
- 扫描版PDF
- 直接读取页面图像
- 电子版PDF
- 按同样方式读取
- 照片
- JPG、PNG、WEBP、HEIC、HEIF
- 每张照片
- 按单页扫描件读取
输出
- Markdown(.md)
- 标题、列表和正文
- 表格
- 以Markdown表格呈现
- 纯文本、可搜索PDF
- 同一次转换生成
- Word(DOCX)
- 按需生成
准确性
- 数字和日期
- 逐位照录
- 看不清的数字
- 用问号标出
- 无法辨认的段落
- 标为 [illegible]
- 跨页表格
- 不合并,每页各成一个表格
使用方式
- 预览
- 免费,无需账号
- 复制文字
- 始终免费
- 下载
- 免费账号
- 较长文档
- 付费方案,详见 linnk.ai/pricing
PDF转Markdown的几种方式对比
Linnk与常见的PDF转Markdown做法有什么不同。
| Feature | Linnk PDF转Markdown | 开源PDF转Markdown库 | 复制粘贴 | 在线PDF转换网站 |
|---|---|---|---|---|
| 使用门槛 | 浏览器上传,无需安装 | 需在本地安装运行;便于写脚本批量处理 | 无 | 浏览器上传 |
| 扫描版PDF和照片 | 由AI模型读取页面图像 | 部分提供OCR模式,效果取决于配置 | 扫描件里没有文字可复制 | 不一定;很多只读取文字层 |
| 标题和列表 | 重建为Markdown标题和列表 | 因库而异 | 粘贴后只剩普通文本行 | 不一定 |
| 表格 | Markdown表格 | 因库而异 | 通常粘贴成零散文字 | 不一定 |
| 看不清的数字和段落 | 用问号或 [illegible] 标出 | 不一定 | 不适用;按文件中存储的文字复制 | 不一定 |
| 文件去向 | 需上传;转换后的文件72小时后删除 | 留在你的电脑上 | 留在你的电脑上 | 视网站而定,上传或在浏览器内处理 |
| 同一次上传的其他输出 | 纯文本、可搜索PDF;Word按需生成 | 取决于所用的库 | 无 | 有时提供其他格式 |
对比信息截至2026年9月。其他工具的功能各不相同且经常变化,请以各工具当前提供的选项为准。
谁需要把PDF转成Markdown
想把文档内容变成可编辑、可搜索、又能交给其他工具处理的人。
开发大模型和RAG应用的工程师
在分块和向量化之前,先把扫描版手册和供应商PDF转成Markdown,参数表就会以行和列的形式出现,而不是一堆打散的文字。
研究人员和学生
把论文、书籍章节和复印资料转成Obsidian或Logseq里的Markdown笔记,章节标题都在原位,方便做双链和整理大纲。
技术文档工程师
把旧的PDF手册迁移到基于Git的文档仓库,或MkDocs、Hugo这类静态网站生成器,再像其他页面一样编辑和评审。
作者和编辑
把旧文章、手稿或扫描的打字稿转回可编辑的Markdown,放进常用的写作软件,不用一页页重新录入。
维护知识库的团队
把扫描的内部制度或供应商的PDF手册以Markdown导入语雀、飞书或Notion,标题和表格都能继续编辑,而不是只躺在附件里。
处理多语种资料的分析师
把中文、阿拉伯文或德文报告按原文转成Markdown,引文和数据都与原始资料一致,之后再检索,或用diff对比不同版本。