基于公开指南,梳理智能体评测、风险清单与合规检查表,形成可审计、可复现的发布控制路径。
作者:进学斋 · 观山书院
全文约3358字 · 阅读约需12分钟
01 背景:Agent 评测为什么不能只跑模型分数
据公开资料,NIST AI 风险管理框架与生成式 AI 相关指南强调:风险来自模型、数据、工具、权限和部署上下文的共同作用,而非单点基准分数。对 Agent 来说,事故是否发生,取决于它能否读取外部内容、拥有哪些凭证、调用哪些工具、任务能否暂停,以及是否有人兜底。
OWASP 等公开威胁资料把提示注入、过度代理、工具滥用、记忆污染、敏感数据外泄列为关键风险。Agent 把这些风险从文本层放大到动作层:一段被污染的网页或文档,可能诱导智能体把只读检索变成越权写入;一次缺少审批的自动调用,可能把建议执行变成真实执行。
从合规角度看,ISO/IEC 42001 式管理体系强调控制、记录、评审和持续改进。团队需要把“可解释、可追溯、可止损”变成默认能力,而不是上线前临时补文档。
从分数到证据

配图·山谷柔绿
02 机制:从评测指标到风险控制的三层结构
任务层:先证明动作可控
任务层关注端到端成功率、步骤完成率、错误恢复率、人工接管率、成本与时延。关键是判断任务是否可暂停、可重试、可追责。每条轨迹应能回答:输入是什么、选择了哪个工具、参数是什么、为何重试、失败在哪一步、谁批准、是否造成副作用。
长任务如果只能在成功后被看见,失败时无法定位到具体步骤,就不适合进入生产。任务层评测要把“完成”拆成“可审计的完成”:每个写操作都有前后状态,每个失败都有恢复策略。
安全层:把对抗样例变成常规回归
安全层覆盖对抗提示、间接注入、越权工具调用、数据外泄、资源滥用、输出毒性、跨会话记忆污染。据行业观察,红队样例不能一次性消耗,要沉淀为版本回归用例,并绑定提示词、模型、工具策略和数据权限版本。
每条高风险动作都要有拦截日志:谁授权、调用什么工具、传入什么参数、结果如何、是否触发审批或熔断。没有日志的拦截,等于没有边界;只有拦截、没有证据,也很难复盘。
合规层:控制点要映射到证据
合规层关注数据最小化、目的限制、访问审批、日志留存、事件响应、供应商责任、人工监督、高风险场景证据链。若面向用户或金融、医疗等高风险领域,还要叠加区域监管要求。
据公开资料,NIST 框架中 GOVERN、MAP、MEASURE、MANAGE 可转化为治理责任、风险映射、持续评测与事件处置闭环。治理不是文件,而是每次发布都能回答:谁负责、风险在哪、怎样测、出了事怎么办。
从清单到门禁

配图·静湖云烟
03 实操:风险清单与合规检查表怎么做
风险清单:七类风险要能落到责任人
风险清单建议按输入、执行、数据、权限、审计、依赖、人工接管七类展开。每条至少写清触发条件、影响面、控制手段和负责人,避免只有一句“注意安全”。
| 类别 | 触发条件 | 影响面 | 控制手段 | 负责人 |
|---|
| 输入 | 用户指令或外部内容包含隐藏指令 | 越权执行、错误规划 | 输入净化、来源标记、指令分层 | 产品与安全 |
| 执行 | 工具返回错误、重试风暴、死循环 | 成本失控、业务中断 | 步骤上限、幂等设计、熔断 | 后端工程 |
| 数据 | 检索结果含敏感信息、跨租户可见 | 合规事故、客户投诉 | 脱敏、最小化、分区隔离 | 数据治理 |
| 权限 | 临时凭证权限过宽、工具可写 | 外部系统被误改或滥用 | 默认只读、审批策略、短期凭证 | 平台与安全 |
| 审计 | 日志缺参数、缺上下文、不可查询 | 无法复盘与定责 | 结构化轨迹、保留策略、检索字段 | SRE 与安全 |
| 依赖 | 模型、插件或供应商变更 | 行为漂移、能力退化 | 版本冻结、变更通知、回归测试 | 架构与测试 |
| 人工接管 | 用户无法停止、审批无界面 | 失控扩大、责任不清 | 一键暂停、审批中心、责任路由 | 产品与运营 |
合规检查表:发布前必须勾选
合规检查表不是合规部门填一次,而是每次发布都要核对。开发团队可按下面清单执行。
- ☐ Agent 是否有唯一身份标识,是否明确 owner、使用场景、运行环境和风险等级。
- ☐ 工具清单是否列出读或写等级、网络可达性、副作用、参数 schema 和幂等要求。
- ☐ 数据源是否标注来源、授权、字段范围、跨租户隔离方式和敏感字段脱敏规则。
- ☐ 审批策略是否区分只读、低风险写、高风险写、外部资金或用户身份变更。
- ☐ 密钥与凭证是否归属独立,是否避免进入 prompt、记忆、普通日志或错误堆栈。
- ☐ 日志目的地是否集中可查,保留周期是否与合同、监管和事故响应要求匹配。
- ☐ 回滚路径是否覆盖模型版本、提示词版本、工具策略版本、依赖版本和已执行动作补偿。
- ☐ 事件上报口径是否明确,是否包含止血、通知、取证、修复和复验步骤。
评测门禁:六类用例决定能否发布
正常任务用于验证主路径;失败任务用于验证恢复;间接注入用于验证外部内容不能劫持执行;越权请求用于验证权限边界;数据外泄用于验证敏感数据不出域;资源耗尽用于验证熔断。
据行业实践,高风险发布前必须通过安全评测和人工审批。门禁规则可写成:任一高风险用例失败,阻断发布;中风险用例失败,允许灰度但必须有缓解措施、监控指标和回滚条件。
证据包:可复现审计包比截图更有价值
证据包字段:任务轨迹 ID、工具调用参数与返回、提示词版本、记忆版本、模型版本、供应商变更、红队报告、拦截日志、残余风险、处置记录、回滚方案。
证据包要能让另一个人复现同一风险判断。没有工具轨迹和版本记录,合规材料只能说明“当时可能安全”。
从选型到治理
04 常见坑与选型:一张表和一个路径
常见坑:把评测误当成合规
常见坑包括:把模型合规当系统合规、只看最终答案忽略工具轨迹、审批只靠模型自觉、日志不可查询、缺少撤销机制、跨 Agent 记忆未隔离。这些坑的共性是只测能力,不测控制。
评测层级对比表:团队当前要补哪一层
| 维度 | 通用 LLM 评测 | 单 Agent 任务评测 | 多 Agent 系统评测 |
|---|
| 核心指标 | 准确率、拒答率、毒性、基准分数 | 成功率、步骤恢复、工具正确率、时延与成本 | 协作成功率、级联失败、资源竞争、记忆隔离 |
| 主要风险 | 幻觉、敏感输出、格式错误 | 间接注入、越权调用、错误写回 | 身份伪造、任务劫持、数据跨边界 |
| 控制点 | 内容过滤、提示约束、模型对齐 | 最小权限、审批、动作日志、重试上限 | 调用认证、隔离域、全局预算、人工接管 |
| 证据要求 | 样本集分数、抽检记录 | 工具轨迹、红队用例、拦截日志 | 调用拓扑、消息签名、审计链、事件报告 |
标准与控制点对比表:把指南翻译成工程动作
| 公开指南或标准 | 关注对象 | Agent 控制点 | 落地证据 |
|---|
| NIST AI RMF | 组织级风险治理与生命周期管理 | 风险登记、指标评测、处置闭环 | 风险清单、发布门禁、事件复盘 |
| OWASP 相关威胁清单 | LLM 与 Agentic 系统攻击面 | 注入防护、工具权限、记忆隔离 | 红队报告、拦截日志、用例回归 |
| ISO/IEC 42001 | AI 管理体系与持续改进 | 政策、职责、审计、供应商控制 | 审批记录、日志保留、管理评审 |
| 区域监管与行业实践 | 高风险场景与用户权益保护 | 人工监督、透明度、可追溯、数据主体响应 | 用户告知、审批界面、留痕证据、投诉复盘 |
风险等级选型路径
低风险只读问答:优先检查幻觉、敏感输出和越权回答;可用离线评测、内容过滤、抽样人工复核。关键是不把答案正确性当作唯一门槛。
中风险内部工具:先做最小权限、审批和动作日志。写操作必须比读操作更严格,必要时引入双人审批、高风险动作白名单或延迟执行。
高风险对外或高敏领域:金融、医疗、身份、资金相关场景应增加人工复核、留存证据、定期红队和上线门禁;评测周期缩短,审批路径前移。
据公开资料与行业观察,团队可以按风险等级选择门禁:低风险版本回归,中风险灰度观察,高风险全量审批。
从发布到持续
05 延伸:让合规变成日常研发流程
把检查表嵌进 PR 与发布
影响面标注、工具权限变更审批、安全评测用例随版本维护、高风险路径回归测试,应进入 PR 模板。开发者提交工具 schema 或权限策略修改时,就应触发审批,而不是等安全团队事后扫描。
建立持续监测
异常工具调用、高成本任务、权限申请激增、用户投诉中的安全事件,要能触发复盘,并沉淀为新的评测用例。安全运营的关键是把一次事故变成长期回归资产。
关注公开指南演进
Agent 身份、工具供应链、记忆治理、跨系统审计会逐步细化。团队应按季度做一次标准映射与风险重排:哪些控制过时,哪些用例缺失,哪些日志无法满足审计。
行动建议
- 第一,把风险清单变成 PR 模板和发布门禁。
- 第二,为每个工具调用建立可查询的审计日志。
- 第三,按季度用公开标准做合规复核与红队回归。
Agent 不是被模型分数证明安全,而是被可复现的证据链证明可控。