PDF 转 Markdown — 在浏览器里抽出文本做笔记
在浏览器把 PDF 文本导出为 Markdown,方便做笔记或粘贴给 LLM——文件留在本机,不上传服务器。步骤:选择带文本层的 PDF,点「转换」,预览结果,再「下载 .md」。示例:单页样例会生成含「Hello PDF to Markdown sample.」的 .md。纯扫描图片 PDF 无 OCR 会失败。加密或损坏文件会给出明确错误。
怎么用
选择 PDF,点「转换」,看预览,再「下载 .md」。按纵向位置拼行,页与页之间用 --- 分隔。组件加载后全程在当前标签页完成,不上传服务器。
规则说明
文本层提取、分页分隔、无 OCR、隐私与失败边界。
- 引擎:页面渲染组件逐页 getTextContent;y 坐标接近的字符合并为一行,行内用空格连接。
- 分页:页与页之间插入空行 + --- + 空行。
- 无 OCR:trim 后为空则硬失败并提示——扫描件需换其他流程。
- 隐私与限制:字节留在标签页;加密/损坏明确报错;超过约 25 MB 可能变慢。
示例
样例生成一页 Helvetica 文本 PDF,转换后在预览区显示该句,并可下载 .md。
适合这些场景
- 办公:把合同条款拷进笔记或 Wiki,免手打。
- 写作者 / AI 用户:把报告正文导出成 Markdown 再编辑或喂给模型。
- 学生:从有文本层的课件 PDF 抽文字进复习笔记。
常见问题
PDF 会上传吗?
不会。页面渲染组件在当前标签页运行(脚本可能从 CDN 加载),PDF 不会上传到我们的服务器。
为什么扫描 PDF 会失败?
扫描件通常是整页图片,没有文本层。本工具不做 OCR,提取为空时会明确报错。
会保留标题或表格吗?
不会。只导出文本层里的字,按位置拼成行;标题、列表、表格不会自动还原成 Markdown 结构。
和「Markdown 转 HTML」有什么区别?
「Markdown 转 HTML」把 Markdown 语法渲染成网页预览;本工具从 PDF 抽出纯文本存成 .md 供编辑或粘贴。
什么时候该用「PDF 转 JPG」?
「PDF 转 JPG」把每页渲染成图片;需要可编辑文字时用本工具,需要页面截图时用 JPG。
咨询与反馈
页面不清、功能异常或想提建议?在下方起草邮件,我们会阅读每一封关于工具的来信。