"这个 Agent 到底有没有干它该干的活"——这是现有评估工具普遍回答不了的问题。
现有工具在测什么
主流的 Agent 评估、红队测试和可观测性工具,测的维度集中在技术指标上:token 效率、延迟表现、提示词注入防护。它们能告诉你系统跑得快不快、稳不稳,但没法回答业务侧真正关心的问题。
项目把 iFixAi 定位成 AI 红队与运营保障之间的那个平衡点,两端都占一点,跑完整套诊断不到 120 秒。
一次运行发生了什么
一个完整的 ifixai run 流程是:引导式设置帮你选定系统、评委和测试套件;运行过程先验证连接并保存配置;随后跨五个支柱执行 32 项检查;最后输出一个 A 到 F 的等级,加上核心支柱的评分卡。
测试套件分五档,可以按需选择:smoke 冒烟、strategic 战略层、core 核心、extended 扩展、all 全量。对于已经跑过一次想接进 CI 的团队,这个分档设计比全量硬跑更实用。
怎么驱动它
三种方式跑的是同一套底层诊断,区别只在配置和驱动方式。
- 引导式向导:装一次,之后每次零参数运行,配置存在 ifixai.yaml
- 显式参数:每个选项都用命令行参数传,完全可脚本化,适合 CI 和审计批次
- 插件或技能:让 Agent 自己去发现配置、搭测试夹具、跑起来并解释评分卡
评委可以是自己、独立第三方厂商,或多评委组合。密钥由向导自动探测,配置文件里只存环境变量名而非密钥本身。
出海视角:合规正在变成工程问题
仓库的话题标签里直接挂着 EU AI Act、ISO 42001、NIST AI RMF 和 OWASP LLM。这几套框架是欧盟、美国和国际通用标准的集合,也是出海产品绕不开的门槛。
把「Agent 行为是否可审计」提前做成工程问题,比在客户审计问卷发过来时再临时补要划算得多。独立开发者在做面向欧盟或美国客户的产品时,这套测试规模能直接当自查清单用。
来源:GitHub