为什么需要
出海做 AI 研究产品(模型评测、prompt 实验、benchmark 验证),人工跑实验一次几小时,招研究员成本又高。Praxist 把研究目标拆成可执行的代码任务,Agent 自动跑实验、写代码、收集数据、生成可验证报告,整条链路一个人就能跑起来。
核心区别于 GPT Researcher 等其他研究 Agent:Praxist 的关键在"可执行级"——研究目标必须能落地为可验证代码任务,跑实验给出量化结论,而不是产出 2000 字报告了事。研究流程每个判断都有 ground truth 可以对照。
怎么用
Python 包安装:
bash
pip install praxist
CLI 跑一个 benchmark 实验:
bash
praxist run --task "compare-gpt-5-vs-claude-on-ml-bench" --budget 50 --model gpt-5 --output ./reports
或者作为 Python 库嵌入产品:
python
from praxist import ResearchAgent
agent = ResearchAgent(model="gpt-5")
result = await agent.run(
goal="验证新 prompt 在 200 条 MMLU 子集上是否优于 baseline",
budget_usd=20,
metrics=["accuracy", "latency"]
)
print(result.report_path) # ./praxist-out/2026-09-19.html
报告自动落到 praxist-out/ 目录,HTML 格式,含每步 trace、token 消耗、ground truth 比对。
使用案例
一个独立开发者用 Praxist 验证 SaaS 的 prompt 优化效果:
- 跑 prompt A vs prompt B 在 100 条真实用户 query 上的胜率对比,预算 $5 自动结束
- 跑新模型版本 vs 旧版本在自家评估集上的回归测试,确认没退化再上线
- 跑 multi-agent vs single-agent 在客户支持场景的端到端对比,3 小时出报告
注意事项
- 需要 OpenAI / Anthropic / Google API key,按 token 消耗付费(预算可控)
- 当前主要跑 benchmark + prompt 实验,生产环境的复杂多步任务仍需人 review
- 报告默认 HTML 格式,可改 markdown
- 出海场景:对接海外模型 API,实验数据本地保存,合规可控