为什么需要
出海做 AI 应用经常要把 PDF/Word/PPT 转成 Markdown 喂给 LLM。传统方案要么装 LibreOffice(重)、要么分页跑 OCR(慢)、要么调云服务(贵)。Anydoc 是 Firecrawl 团队开源的文档转换引擎,用 Rust 实现,单数字毫秒级返回干净 GFM Markdown,Node.js、Python、WASM 三端绑定都能用。
最大卖点是输出格式一致——不管输入是 Word、PPT、Excel 还是 PDF,转出来都是同一种 Markdown 结构。给 LLM 做 RAG 或喂给 Claude/GPT 时不用为每种格式单独写 prompt 处理差异。Firecrawl Parse 在线服务就是用这个库撑着的,所以生产稳定性有保障。
怎么用
Node.js 装:
npm install @firecrawl/anydoc
一行调用:
const { convertFile } = require("@firecrawl/anydoc");
const md = await convertFile("report.pdf");
console.log(md); // 干净的 Markdown
Python 装:
pip install firecrawl-anydoc
import anydoc
markdown = anydoc.convert_file("report.pdf")
也支持 Agent Skill 形式:
npx skills add firecrawl/anydoc
Claude Code、Codex、Cursor 等 Agent 直接调用,扫描文档自动转 Markdown 进 prompt。
核心特性
- 多格式输入 — Word、PowerPoint、Excel、OpenDocument、RTF、EPUB、CSV、PDF 八种格式
- 毫秒级响应 — Rust 实现,单文件转换通常 < 10ms(不需 OCR 的纯文档)
- 统一输出 — 不管输入格式,输出都是同一种 GFM Markdown 结构
- 三端绑定 — Node.js、Python、WebAssembly 全覆盖
- Agent Skill 化 — 官方支持 Claude Code、Codex、Cursor 等主流 Agent 加载
- MIT 协议 — 完全开源可商用
- 浏览器 Demo — firecrawl.github.io/anydoc WASM 版本可在浏览器本地转文件,数据不出本机
使用案例
独立开发者做一个面向海外用户的 AI 文档问答 SaaS。用户上传 PDF/Word/PPT 合同、产品手册、研报,系统解析后做 RAG 检索问答。传统方案接 Adobe API(贵)或自己写格式解析器(重)。Anydoc 一个 npm 包搞定,平均 5-10ms 一份文档,2C2G VPS 一天处理 10 万份文档无压力。
另一个场景:本地工具整合。出海开发者用 Claude Code 写代码时,让 Agent 直接读本地 PDF 文档——npx skills add firecrawl/anydoc 后 Agent 自动获得 PDF/Word 读取能力,不用手动转换。
注意事项
- 完全免费开源,MIT 协议
- 扫描件 PDF(图片型)需要配合 Firecrawl Parse OCR,Anydoc 单独跑只能处理文本型 PDF
- 输出格式固定为 GFM Markdown,需要自定义格式(比如保留原表格样式)需要后处理
- 比 Pandoc 更轻更快,但 Pandoc 支持的格式更多(LaTeX 等学术格式 anydoc 不支持)
- 浏览器 WASM 版本文件大小 ~3MB,首屏加载需等 1-2 秒