当前位置:首页>排行榜>从模型分数到控制回路:Agent 评测、风险清单与发布门禁

从模型分数到控制回路:Agent 评测、风险清单与发布门禁

  • 更新时间 2026-09-20 00:16:05
从模型分数到控制回路:Agent 评测、风险清单与发布门禁

基于公开指南,梳理智能体评测、风险清单与合规检查表,形成可审计、可复现的发布控制路径。

作者:进学斋 · 观山书院

全文约3358字 · 阅读约需12分钟


01 背景:Agent 评测为什么不能只跑模型分数

据公开资料,NIST AI 风险管理框架与生成式 AI 相关指南强调:风险来自模型、数据、工具、权限和部署上下文的共同作用,而非单点基准分数。对 Agent 来说,事故是否发生,取决于它能否读取外部内容、拥有哪些凭证、调用哪些工具、任务能否暂停,以及是否有人兜底。

OWASP 等公开威胁资料把提示注入、过度代理、工具滥用、记忆污染、敏感数据外泄列为关键风险。Agent 把这些风险从文本层放大到动作层:一段被污染的网页或文档,可能诱导智能体把只读检索变成越权写入;一次缺少审批的自动调用,可能把建议执行变成真实执行。

从合规角度看,ISO/IEC 42001 式管理体系强调控制、记录、评审和持续改进。团队需要把“可解释、可追溯、可止损”变成默认能力,而不是上线前临时补文档。

从分数到证据

配图·山谷柔绿

02 机制:从评测指标到风险控制的三层结构

任务层:先证明动作可控

任务层关注端到端成功率、步骤完成率、错误恢复率、人工接管率、成本与时延。关键是判断任务是否可暂停、可重试、可追责。每条轨迹应能回答:输入是什么、选择了哪个工具、参数是什么、为何重试、失败在哪一步、谁批准、是否造成副作用。

长任务如果只能在成功后被看见,失败时无法定位到具体步骤,就不适合进入生产。任务层评测要把“完成”拆成“可审计的完成”:每个写操作都有前后状态,每个失败都有恢复策略。

安全层:把对抗样例变成常规回归

安全层覆盖对抗提示、间接注入、越权工具调用、数据外泄、资源滥用、输出毒性、跨会话记忆污染。据行业观察,红队样例不能一次性消耗,要沉淀为版本回归用例,并绑定提示词、模型、工具策略和数据权限版本。

每条高风险动作都要有拦截日志:谁授权、调用什么工具、传入什么参数、结果如何、是否触发审批或熔断。没有日志的拦截,等于没有边界;只有拦截、没有证据,也很难复盘。

合规层:控制点要映射到证据

合规层关注数据最小化、目的限制、访问审批、日志留存、事件响应、供应商责任、人工监督、高风险场景证据链。若面向用户或金融、医疗等高风险领域,还要叠加区域监管要求。

据公开资料,NIST 框架中 GOVERN、MAP、MEASURE、MANAGE 可转化为治理责任、风险映射、持续评测与事件处置闭环。治理不是文件,而是每次发布都能回答:谁负责、风险在哪、怎样测、出了事怎么办。

从清单到门禁

配图·静湖云烟

03 实操:风险清单与合规检查表怎么做

风险清单:七类风险要能落到责任人

风险清单建议按输入、执行、数据、权限、审计、依赖、人工接管七类展开。每条至少写清触发条件、影响面、控制手段和负责人,避免只有一句“注意安全”。

类别触发条件影响面控制手段负责人
输入用户指令或外部内容包含隐藏指令越权执行、错误规划输入净化、来源标记、指令分层产品与安全
执行工具返回错误、重试风暴、死循环成本失控、业务中断步骤上限、幂等设计、熔断后端工程
数据检索结果含敏感信息、跨租户可见合规事故、客户投诉脱敏、最小化、分区隔离数据治理
权限临时凭证权限过宽、工具可写外部系统被误改或滥用默认只读、审批策略、短期凭证平台与安全
审计日志缺参数、缺上下文、不可查询无法复盘与定责结构化轨迹、保留策略、检索字段SRE 与安全
依赖模型、插件或供应商变更行为漂移、能力退化版本冻结、变更通知、回归测试架构与测试
人工接管用户无法停止、审批无界面失控扩大、责任不清一键暂停、审批中心、责任路由产品与运营

合规检查表:发布前必须勾选

合规检查表不是合规部门填一次,而是每次发布都要核对。开发团队可按下面清单执行。

  • ☐ Agent 是否有唯一身份标识,是否明确 owner、使用场景、运行环境和风险等级。
  • ☐ 工具清单是否列出读或写等级、网络可达性、副作用、参数 schema 和幂等要求。
  • ☐ 数据源是否标注来源、授权、字段范围、跨租户隔离方式和敏感字段脱敏规则。
  • ☐ 审批策略是否区分只读、低风险写、高风险写、外部资金或用户身份变更。
  • ☐ 密钥与凭证是否归属独立,是否避免进入 prompt、记忆、普通日志或错误堆栈。
  • ☐ 日志目的地是否集中可查,保留周期是否与合同、监管和事故响应要求匹配。
  • ☐ 回滚路径是否覆盖模型版本、提示词版本、工具策略版本、依赖版本和已执行动作补偿。
  • ☐ 事件上报口径是否明确,是否包含止血、通知、取证、修复和复验步骤。

评测门禁:六类用例决定能否发布

正常任务用于验证主路径;失败任务用于验证恢复;间接注入用于验证外部内容不能劫持执行;越权请求用于验证权限边界;数据外泄用于验证敏感数据不出域;资源耗尽用于验证熔断。

据行业实践,高风险发布前必须通过安全评测和人工审批。门禁规则可写成:任一高风险用例失败,阻断发布;中风险用例失败,允许灰度但必须有缓解措施、监控指标和回滚条件。

证据包:可复现审计包比截图更有价值

证据包字段:任务轨迹 ID、工具调用参数与返回、提示词版本、记忆版本、模型版本、供应商变更、红队报告、拦截日志、残余风险、处置记录、回滚方案。

证据包要能让另一个人复现同一风险判断。没有工具轨迹和版本记录,合规材料只能说明“当时可能安全”。

从选型到治理

04 常见坑与选型:一张表和一个路径

常见坑:把评测误当成合规

常见坑包括:把模型合规当系统合规、只看最终答案忽略工具轨迹、审批只靠模型自觉、日志不可查询、缺少撤销机制、跨 Agent 记忆未隔离。这些坑的共性是只测能力,不测控制。

评测层级对比表:团队当前要补哪一层

维度通用 LLM 评测单 Agent 任务评测多 Agent 系统评测
核心指标准确率、拒答率、毒性、基准分数成功率、步骤恢复、工具正确率、时延与成本协作成功率、级联失败、资源竞争、记忆隔离
主要风险幻觉、敏感输出、格式错误间接注入、越权调用、错误写回身份伪造、任务劫持、数据跨边界
控制点内容过滤、提示约束、模型对齐最小权限、审批、动作日志、重试上限调用认证、隔离域、全局预算、人工接管
证据要求样本集分数、抽检记录工具轨迹、红队用例、拦截日志调用拓扑、消息签名、审计链、事件报告

标准与控制点对比表:把指南翻译成工程动作

公开指南或标准关注对象Agent 控制点落地证据
NIST AI RMF组织级风险治理与生命周期管理风险登记、指标评测、处置闭环风险清单、发布门禁、事件复盘
OWASP 相关威胁清单LLM 与 Agentic 系统攻击面注入防护、工具权限、记忆隔离红队报告、拦截日志、用例回归
ISO/IEC 42001AI 管理体系与持续改进政策、职责、审计、供应商控制审批记录、日志保留、管理评审
区域监管与行业实践高风险场景与用户权益保护人工监督、透明度、可追溯、数据主体响应用户告知、审批界面、留痕证据、投诉复盘

风险等级选型路径

低风险只读问答:优先检查幻觉、敏感输出和越权回答;可用离线评测、内容过滤、抽样人工复核。关键是不把答案正确性当作唯一门槛。

中风险内部工具:先做最小权限、审批和动作日志。写操作必须比读操作更严格,必要时引入双人审批、高风险动作白名单或延迟执行。

高风险对外或高敏领域:金融、医疗、身份、资金相关场景应增加人工复核、留存证据、定期红队和上线门禁;评测周期缩短,审批路径前移。

据公开资料与行业观察,团队可以按风险等级选择门禁:低风险版本回归,中风险灰度观察,高风险全量审批。

从发布到持续

05 延伸:让合规变成日常研发流程

把检查表嵌进 PR 与发布

影响面标注、工具权限变更审批、安全评测用例随版本维护、高风险路径回归测试,应进入 PR 模板。开发者提交工具 schema 或权限策略修改时,就应触发审批,而不是等安全团队事后扫描。

建立持续监测

异常工具调用、高成本任务、权限申请激增、用户投诉中的安全事件,要能触发复盘,并沉淀为新的评测用例。安全运营的关键是把一次事故变成长期回归资产。

关注公开指南演进

Agent 身份、工具供应链、记忆治理、跨系统审计会逐步细化。团队应按季度做一次标准映射与风险重排:哪些控制过时,哪些用例缺失,哪些日志无法满足审计。

行动建议

  • 第一,把风险清单变成 PR 模板和发布门禁。
  • 第二,为每个工具调用建立可查询的审计日志。
  • 第三,按季度用公开标准做合规复核与红队回归。
Agent 不是被模型分数证明安全,而是被可复现的证据链证明可控。

随机文章