← 工具

PixelRAG

Berkeley 出品的视觉 RAG 检索增强生成框架,把网页截屏转图片向量化搜索,保留表格/图表/布局等视觉信息。Claude Code 原生集成像素浏览 skill 替代 HTML 抓取,预建索引覆盖 828 万 Wikipedia 页面,文档检索准确率显著超越文本 RAG,Stars 3.3K+

#64
推荐排名
3,351
GitHub Stars
2,346
推荐得分
视觉 RAG 检索 / 文档视觉理解
适用场景
AI工具RAGAI应用数据采集Python

为什么需要

出海做 AI 产品,传统 RAG 把网页解析成纯文本时丢掉了表格、图表、布局这些视觉信息。问「Wikipedia 上 Python 页面里那段示例代码的运行结果是什么?」,文本 RAG 只能拿到代码块,读不到右侧的输出表格。PixelRAG 反过来:把整页截成图片,直接用多模态 embedding 检索,视觉信息全保留。论文证实,在 Wikipedia 这种含图表的语料上准确率显著高于文本 RAG。

对独立开发者的实际价值:你想做一个面向海外用户的 AI 知识助手(产品文档问答、技术博客总结、新闻分析),现有方案要么用 Firecrawl 把 HTML 转 Markdown(丢图表),要么用 screenshot API 但要自己处理视觉理解。PixelRAG 一行命令接管整个视觉检索流水线,从渲染、embed 到 search API 都齐全,Apache-2.0 开源、自托管免费。

怎么用

Python 3.10+ 环境一行安装:

bash
pip install pixelrag

最简的两步操作——把页面截成图片、搜索视觉索引:

bash
# 渲染网页/文档为截屏 tiles
pixelshot https://en.wikipedia.org/wiki/Python --output ./tiles

# 直接调 hosted API 搜索 828 万 Wikipedia 页面(免 setup、免 API key)
curl -X POST https://api.pixelrag.ai/search \
  -H "Content-Type: application/json" \
  -d '{"queries": [{"text": "What is the capital of France?"}], "n_docs": 5}'

官方托管 API 直接用,自己建索引也支持:

bash
pip install 'pixelrag[embed]'
huggingface-cli download StarTrail-org/pixelrag-faiss-indexes \
  --repo-type dataset --include "search_index_normed_v2/*" --local-dir ./index
pixelrag serve --index-dir ./index/search_index_normed_v2 --port 30001

Claude Code 集成(核心亮点):

bash
uv tool install pixelrag
claude plugin marketplace add StarTrail-org/PixelRAG
claude plugin install pixelbrowse@pixelrag-plugins

装好后让 Claude 帮你看网页:

bash
claude -p "screenshot https://news.ycombinator.com and summarize the top stories"
claude -p "screenshot https://arxiv.org/abs/2404.12387 and explain the key findings"

不用 MCP server、不用后端,skill 直接调用你机器上的 pixelshot CLI(基于 Playwright/CDP)。

使用案例

独立开发者做一个海外产品的「AI 文档助手」功能:用户上传 PDF 或粘贴 URL,AI 回答里面的数据问题(含图表、表格)。用 PixelRAG + Ollama(本地 VLM):上传 PDF → 截屏分块 → 向量化索引 → 用户提问时检索相关 tile → LLM 看图回答。整个流水线自托管、零 API 费用、视觉信息不丢失。

另一个场景:出海调研团队需要快速总结竞品博客文章。传统做法是 Readability + LLM 总结,但表格数据、嵌入的产品截图都没了。用 PixelRAG 的 Claude Code plugin,让 Claude 直接看截图——产品对比表、技术架构图、定价截图全部能被问到。

注意事项

  • 完全免费开源(Apache-2.0 协议),官方 hosted API 也免费(无需 key)
  • 索引构建需要 GPU(约 3 分钟 Apple M 系列,约 1 分钟 GPU),搜索查询 CPU 即可
  • 预训练模型 Qwen3-VL-Embedding-2B 已发布到 Hugging Face,可独立部署
  • 完整训练数据集也开源(Chrisyichuan/screenshot-training-natural-filtered-v2),可自行微调其他 VLM embedding
  • macOS(Apple Silicon / MPS)、Linux(CUDA)、CPU 全平台支持,device: auto 自动选最佳后端
  • 与 Firecrawl 的关系:Firecrawl 擅长把网页转结构化 Markdown 做文本 RAG;PixelRAG 擅长保留视觉信息做视觉 RAG。两个工具互补,不互斥