为什么需要
出海做 AI 客服、企业知识库、智能问答系统,最核心的是 RAG(检索增强生成)。开源 RAG 方案要么文档解析差(切块不合理),要么回答「幻觉」严重(没有 grounded 引用)。RAGFlow 由 infiniflow 出品,专注深度文档理解——基于 OCR + 布局分析 + 表格识别把 PDF/Word/Excel/图片解析成结构化块,每条回答都附带原始文档引用,可信度直接对标企业级产品。
对比 Dify:Dify 偏工作流编排(包含 RAG 但不专精),RAGFlow 专攻 RAG(解析精度更高、引用更全)。
怎么用
Docker 一键部署:
bash
git clone https://github.com/infiniflow/ragflow.git
cd ragflow/docker
docker compose up -d
打开 http://localhost:80,注册账号,创建知识库:
- 上传文档(PDF/Word/Excel/PPT/图片/Markdown/HTML 都支持)
- 选择解析方式(OCR、布局识别、表格识别、公式识别)
- 选择 Embedding 模型(OpenAI、BGE、智谱等)
- 创建 Chat Assistant,配置 prompt 和 LLM
- 通过 API 集成到业务系统
API 调用:
python
import requests
resp = requests.post(
"http://localhost/v1/chats/openai_compatible/your-chat-id",
headers={"Authorization": "Bearer YOUR_API_KEY"},
json={
"model": "gpt-4",
"messages": [{"role": "user", "content": "产品保修期是多久?"}]
}
)
print(resp.json())
核心特性
- 深度文档理解 — OCR + 布局分析 + 表格识别 + 公式识别
- 多格式支持 — PDF、Word、Excel、PPT、图片、Markdown、HTML、EPUB
- 智能分块 — 基于模板的分块策略,比传统 fixed-size chunk 准确度提升 30-50%
- Grounded 引用 — 每条回答附原始文档来源,可信可验证
- 多 LLM 支持 — OpenAI、Anthropic、Google、智谱、DeepSeek、Qwen 等
- 多 Embedding — BGE、智谱、OpenAI text-embedding-3 等
- 可视化配置 — Web UI 拖拽配置知识库和 Chat Assistant
- REST API — OpenAI 兼容协议,现有 OpenAI 代码改一行 base URL 即可
- 多语言 — 中英日韩法印尼阿拉伯等 10+ 语言 README
使用案例
出海做企业级 SaaS(合规咨询行业),需要 RAG 检索 50 个国家的法律文档给客户当助手。RAGFlow 配 GPT-4 + 表格识别,把复杂的法律条款 PDF 准确解析并按章节分块。客户问「欧盟 GDPR 第 17 条怎么适用」,RAGFlow 回答原文 + 文档来源 + 上下文段引用。整套系统 GitHub 自托管,数据不出服务器,合规无忧。
注意事项
- Apache 2.0 协议开源,可商用
- Docker 部署至少 4C8G + 50GB 存储起步(OCR 模型较大)
- 推荐海外 VPS 部署(OpenAI/Anthropic API 速度更好)
- 与 Dify 对比:Dify 工作流编排灵活,RAGFlow RAG 深度更深
- 与 QAnything 对比:QAnything 国内友好,RAGFlow 国际生态更好