AI Agent 该由谁来审计:iFixAi 120 秒跑完 32 项检查,对齐 EU AI Act 和 NIST

AI 摘要

Agent 评估工具大多在测 token 效率和延迟,iFixAi 换了个问题:基于业务 KPI,这个 Agent 到底有没有干它该干的活。它一次运行跨 5 大支柱执行 32 项检查,输出 A 到 F 的等级和核心支柱评分卡,并内置 smoke、strategic、core、extended、all 五套测试规模。仓库话题直接挂上了 EU AI Act、ISO 42001 和 NIST AI RMF。

2026-10-04·出海情报站·阅读需3分钟

"这个 Agent 到底有没有干它该干的活"——这是现有评估工具普遍回答不了的问题。

现有工具在测什么

主流的 Agent 评估、红队测试和可观测性工具,测的维度集中在技术指标上:token 效率、延迟表现、提示词注入防护。它们能告诉你系统跑得快不快、稳不稳,但没法回答业务侧真正关心的问题。

项目把 iFixAi 定位成 AI 红队与运营保障之间的那个平衡点,两端都占一点,跑完整套诊断不到 120 秒。

一次运行发生了什么

一个完整的 ifixai run 流程是:引导式设置帮你选定系统、评委和测试套件;运行过程先验证连接并保存配置;随后跨五个支柱执行 32 项检查;最后输出一个 A 到 F 的等级,加上核心支柱的评分卡。

测试套件分五档,可以按需选择:smoke 冒烟、strategic 战略层、core 核心、extended 扩展、all 全量。对于已经跑过一次想接进 CI 的团队,这个分档设计比全量硬跑更实用。

怎么驱动它

三种方式跑的是同一套底层诊断,区别只在配置和驱动方式。

  • 引导式向导:装一次,之后每次零参数运行,配置存在 ifixai.yaml
  • 显式参数:每个选项都用命令行参数传,完全可脚本化,适合 CI 和审计批次
  • 插件或技能:让 Agent 自己去发现配置、搭测试夹具、跑起来并解释评分卡

评委可以是自己、独立第三方厂商,或多评委组合。密钥由向导自动探测,配置文件里只存环境变量名而非密钥本身。

出海视角:合规正在变成工程问题

仓库的话题标签里直接挂着 EU AI Act、ISO 42001、NIST AI RMF 和 OWASP LLM。这几套框架是欧盟、美国和国际通用标准的集合,也是出海产品绕不开的门槛。

把「Agent 行为是否可审计」提前做成工程问题,比在客户审计问卷发过来时再临时补要划算得多。独立开发者在做面向欧盟或美国客户的产品时,这套测试规模能直接当自查清单用。

来源:GitHub