跳到内容

下午好,继续加油,离目标更近一步。

MarkItDown:把 PDF/Office 转成 Markdown 喂给大模型

MarkItDown:把 PDF/Office 转成 Markdown 喂给大模型

leaf
leaf
1 分钟阅读 评论 0

阅读要点

先读这里,快速了解全文在讲什么

核心结论

做 RAG 或拿本地文档微调时,最大的痛点往往是 PDF 排版乱、Word 表格识别难、图片里的文字还要另外 OCR。微软开源的 MarkItDown 把这一串流程收成一条命令:PDF、Word、Excel、PPT、图片、音视频都能转成干净的 Markdown,喂给大模型之前省掉大量手工清洗。特别适合正在搭知识库、做 Agent 数据预处理,或者只是想用 ChatGPT 分析本地文件的朋友。核心看点- 格式覆盖广:Office 三件套、…

你可以了解到

阅读后可获得与「MarkItDown:把 PDF/Office 转成 Markdown 喂给大模型」相关的实用信息与站内延伸资源;最后更新 2026年8月4日。

内容更新于 2026年8月4日

做 RAG 或拿本地文档微调时,最大的痛点往往是 PDF 排版乱、Word 表格识别难、图片里的文字还要另外 OCR。微软开源的 MarkItDown 把这一串流程收成一条命令:PDF、Word、Excel、PPT、图片、音视频都能转成干净的 Markdown,喂给大模型之前省掉大量手工清洗。特别适合正在搭知识库、做 Agent 数据预处理,或者只是想用 ChatGPT 分析本地文件的朋友。

核心看点

格式覆盖广:Office 三件套、PDF、EPUB、HTML 甚至带文字的视频、音频都能处理,图片可走 OCR 提取文字,算是给 LLM 准备的“万能转马克钉”。
CLI 与库双形态:既能在终端一行命令转换,也能 from markitdown import MarkItDown 嵌入 Python 脚本,接进 RAG、Agent 的数据管线很顺。
扩展机制友好:自带 MarkdownConverter 基类,想接自己的 OCR、ASR 服务或私有解析器都可以,不用等官方更新。

github.com
▲ github.com(阿里云通义万相 生成配图,非网页截图)

适合谁

做 RAG 的知识库工程师、需要给大模型预处理文档的开发者,以及日常整理资料的信息工作者。Python 环境 3.10+ 即可,基础转换在本地完成不需要 GPU;若要用云端 OCR/ASR,可以在配置里接入 Azure 等服务,官网 README 有例子。许可证是 MIT,放心二开。

如果你想看完整的支持列表和接入方式,直接翻 README 上的示例,比文档还直观。对了,项目最近还在更新,提 issue 也是有人管的。顺手去 MarkItDown 仓库 点个 Star 备用,下次同事让你解析脏文件时就能拿出来顶上了。

常见问题

MarkItDown:把 PDF/Office 转成 Markdown 喂给大模型 是什么?

做 RAG 或拿本地文档微调时,最大的痛点往往是 PDF 排版乱、Word 表格识别难、图片里的文字还要另外 OCR。微软开源的 MarkItDown 把这一串流程收成一条命令:PDF、Word、Excel、PPT、图片、音视频都能转成干净的 Markdown,喂给大模型之前省掉大量手工清洗。特别适合正在搭知识库、做 Agent 数据预处理,或者只是想用 ChatGPT 分析本地文件的朋友。核心看点- 格式覆盖广:Office 三件套、…

读完本文可以了解什么?

阅读后可获得与「MarkItDown:把 PDF/Office 转成 Markdown 喂给大模型」相关的实用信息与站内延伸资源;最后更新 2026年8月4日。

「MarkItDown:把 PDF/Office 转成 Markdown 喂给大模型」属于哪些主题?

本文分类包括:GitHub项目。可在对应分类页查看更多相关内容。

发表评论

Welcome! This site is in Chinese. Tap EN in the top bar to read in English.