← 工具

Unlimited-OCR

百度开源的 OCR 工具,支持一次性长视界解析(百页 PDF、整本书籍、多场景混合),端到端识别无需拼接。处理 1000 页文档只需一次前向推理,比传统多页 OCR 快 10 倍以上,独立开发者处理扫描件必备工具,GitHub 20K+。

#32
推荐排名
20,707
GitHub Stars
32,303
推荐得分
长文档 OCR / 扫描件识别
适用场景
AI工具AI应用数据采集Python

为什么需要

做出海产品经常处理 PDF 扫描件、长文档、合同——传统 OCR 模型一次只能识别几页,100 页 PDF 要切成几十块跑几十次,结果拼接还容易错位。Unlimited OCR 走一次性长视界路线,整个文档一次前向推理出结果,速度和准确度都远超传统分块方案。

百度官方出品,处理扫描件、表格、公式、混合排版文档场景业界领先。MIT 协议免费开源,Python + HuggingFace 生态友好。

怎么用

bash
pip install unlimited-ocr
python
from unlimited_ocr import UnlimitedOCR
ocr = UnlimitedOCR.from_pretrained("baidu/unlimited-ocr")
result = ocr.process("100_page_contract.pdf")

支持图像、PDF、整本书籍;输出 Markdown + LaTeX 公式 + 表格结构。

注意事项

  • MIT 协议,完全免费
  • 模型较大(~5GB),需要至少 16GB GPU(或用量化版)
  • 处理中文文档效果最佳,多语言支持需要确认
  • 端到端识别,不依赖版面分析预处理