← 工具

Praxist

可执行级 AI 研究自动化系统,把研究目标拆解成可验证的代码任务,自动跑实验并沉淀结论,5K+ Stars,Sapient 团队出品,适合做海外 AI 研究产品的独立开发者接入替代昂贵人工研究流程

#36
推荐排名
5,982
GitHub Stars
9,331.9
推荐得分
AI 自动化研究 / 可验证实验
适用场景
AI工具AI AgentLLM自动化Python

为什么需要

出海做 AI 研究产品(模型评测、prompt 实验、benchmark 验证),人工跑实验一次几小时,招研究员成本又高。Praxist 把研究目标拆成可执行的代码任务,Agent 自动跑实验、写代码、收集数据、生成可验证报告,整条链路一个人就能跑起来。

核心区别于 GPT Researcher 等其他研究 Agent:Praxist 的关键在"可执行级"——研究目标必须能落地为可验证代码任务,跑实验给出量化结论,而不是产出 2000 字报告了事。研究流程每个判断都有 ground truth 可以对照。

怎么用

Python 包安装:

bash
pip install praxist

CLI 跑一个 benchmark 实验:

bash
praxist run --task "compare-gpt-5-vs-claude-on-ml-bench"   --budget 50 --model gpt-5 --output ./reports

或者作为 Python 库嵌入产品:

python
from praxist import ResearchAgent

agent = ResearchAgent(model="gpt-5")
result = await agent.run(
    goal="验证新 prompt 在 200 条 MMLU 子集上是否优于 baseline",
    budget_usd=20,
    metrics=["accuracy", "latency"]
)
print(result.report_path)  # ./praxist-out/2026-09-19.html

报告自动落到 praxist-out/ 目录,HTML 格式,含每步 trace、token 消耗、ground truth 比对。

使用案例

一个独立开发者用 Praxist 验证 SaaS 的 prompt 优化效果:

  • 跑 prompt A vs prompt B 在 100 条真实用户 query 上的胜率对比,预算 $5 自动结束
  • 跑新模型版本 vs 旧版本在自家评估集上的回归测试,确认没退化再上线
  • 跑 multi-agent vs single-agent 在客户支持场景的端到端对比,3 小时出报告

注意事项

  • 需要 OpenAI / Anthropic / Google API key,按 token 消耗付费(预算可控)
  • 当前主要跑 benchmark + prompt 实验,生产环境的复杂多步任务仍需人 review
  • 报告默认 HTML 格式,可改 markdown
  • 出海场景:对接海外模型 API,实验数据本地保存,合规可控