为什么需要
做出海产品经常处理 PDF 扫描件、长文档、合同——传统 OCR 模型一次只能识别几页,100 页 PDF 要切成几十块跑几十次,结果拼接还容易错位。Unlimited OCR 走一次性长视界路线,整个文档一次前向推理出结果,速度和准确度都远超传统分块方案。
百度官方出品,处理扫描件、表格、公式、混合排版文档场景业界领先。MIT 协议免费开源,Python + HuggingFace 生态友好。
怎么用
bash
pip install unlimited-ocr
python
from unlimited_ocr import UnlimitedOCR
ocr = UnlimitedOCR.from_pretrained("baidu/unlimited-ocr")
result = ocr.process("100_page_contract.pdf")
支持图像、PDF、整本书籍;输出 Markdown + LaTeX 公式 + 表格结构。
注意事项
- MIT 协议,完全免费
- 模型较大(~5GB),需要至少 16GB GPU(或用量化版)
- 处理中文文档效果最佳,多语言支持需要确认
- 端到端识别,不依赖版面分析预处理