当前位置:首页>排行榜>中移智库:智能体安全评测体系与实践白皮书 2026

中移智库:智能体安全评测体系与实践白皮书 2026

  • 更新时间 2026-09-26 06:41:01
中移智库:智能体安全评测体系与实践白皮书 2026

本白皮书由中移智库牵头,中国移动通信研究院联合多家科研机构、高校、产业单位共同编制,针对具备自主决策、工具调用、多轮交互、记忆管理能力 AI 智能体,搭建完整安全评测体系,并结合开源框架 OpenClaw 开展实测验证,为智能体安全测评、架构设计、风险治理提供标准化参考。

一、背景概述

智能体已经实现产业化落地,广泛用于企业服务、政务办公、软件开发等场景。和传统大模型单轮问答不同,智能体拥有完整自主运行闭环,带来全新安全风险:攻击面广、隐蔽性强、风险传导快、危害持久,可遭受目标劫持、间接提示注入、记忆投毒、多轮渐进渗透等攻击。传统 AI 安全评测侧重静态输出内容合规,无法覆盖工具调用、自主决策、记忆读写等动态链路,存在大量评测盲区。全球监管持续收紧,欧盟、美国、新加坡相继出台法规与治理框架,对智能体提出可验证、可追溯安全评测硬性要求,行业急需建立智能体专属评测体系,推动安全评测从静态结果合规转向动态行为可信。

智能体分为五大应用类型:研究型智能体、全流程软件开发智能体、任务自动化与工作流智能体、智能体框架与平台,还有面向垂直业务的各类应用;技术上分为感知、记忆、决策、执行四层架构,叠加底层基础大模型。

二、智能体四层架构安全风险

  1. 感知层:是外部数据唯一入口,主要风险为信任边界失守。外部输入不可信,校验隔离缺失。攻击者通过多通道实施提示注入、恶意载荷投递,风险可向上渗透污染记忆、劫持决策,属于第一道安全关口。
  2. 记忆层:包含短期会话记忆与长期向量知识库,风险特点是存量污染、长期潜伏、跨会话生效。记忆投毒攻击不会即时暴露,恶意记忆跨任务持续干扰推理,还存在隐私批量泄露风险,防御难度高。
  3. 决策层:风险来自上游感知、记忆风险汇聚,发生推理链路级联失效。长上下文容易丢失安全规则,智能体为达成子目标可能主动规避安全约束;多轮诱导会篡改业务目标,风险在此放大后直接传递到执行层。
  4. 执行层:风险最终落地,转化成真实业务损害。存在权限管控缺失、供应链隐患、高危操作拆分绕过检测等问题;各类风险叠加,会造成系统损毁、数据泄露、业务中断等实质性后果。

整体智能体风险存在跨层传导、叠加、潜伏特征,传统面向大模型输出结果的测评体系无法适配智能体长链路、强自主的特性。

三、智能体四大维度安全评测体系

白皮书突破传统测评范式,设计基模安全、交互安全、运行安全、基础安全四大评测维度,覆盖智能体全生命周期,配套大量二级可量化评测指标,形成 “风险识别‑评估检测‑风险分析‑处置加固‑持续监控‑迭代优化” 全链路安全闭环。

  1. 基模安全:针对底层大模型本体原生安全,与上层应用架构解耦。涵盖对抗样本防御、幻觉抑制、决策校准、安全对齐、偏见歧视抑制、有害内容防御等指标,衡量模型本身安全基线。
  2. 交互安全:对应感知层风险,面向全部对外交互入口。覆盖直接 / 间接提示注入防御、多轮策略绕过、工具调用链路安全、风险分级授权、匿名用户风险管控等,防范外部恶意载荷入侵。
  3. 运行安全:覆盖记忆层、决策层动态运行风险。包含紧急任务关停、目标漂移管控、自主迭代安全、动态权限越权防控、多智能体合谋防御等,管控运行过程中风险放大、渐进诱导、记忆污染带来的问题。
  4. 基础安全:对应执行层以及底层支撑环境。包含沙箱环境隔离、记忆投毒防护、会话记忆隔离、供应链物料安全、MCP / 插件安全、审计日志、A2A 智能体通信鉴权、凭证保护等,阻止风险转化为真实安全损失。

评测配套手段包含评测数据集、威胁建模、自动化评测、人工评审、红蓝对抗,输出风险清单、评测报告、安全评分、改进建议、合规证明。

四、OpenClaw 开源智能体实测实践

选取开源智能体框架 OpenClaw 开展实测,完整走通 “用户输入‑模型推理‑工具调用‑外部资源访问‑本地执行” 链路,评测发现其风险并非单一漏洞,而是多环节串联形成组合风险:

  1. 基模安全:幻觉问题突出,复杂对抗扰动、长多步骤推理下安全约束失效,存在歧视生成,部分医疗违规请求拦截失效;
  2. 交互安全:多轮策略绕过防护薄弱,间接注入、工具调用链路缺少校验,恶意伪装脚本可以执行,风险分级授权存在缺陷;
  3. 运行安全:存在决策偏差传染、长链路目标漂移、自主迭代安全约束可被移除、权限越权等问题;
  4. 基础安全:是重灾区,缺少沙箱隔离,记忆投毒可生效,跨文档、外部检索内容的恶意指令可进入推理链路;供应链、插件、MCP 工具缺少校验;敏感信息前端提示拒绝但内部链路仍存在明文泄露,缺少统一身份认证。

测试验证这套评测体系可以有效覆盖智能体主要风险。基于测试结果提出治理建议:

  1. 收敛智能体默认能力边界,落实白名单、最小权限、分级授权;
  2. 建立信任边界,把网页、API 返回、第三方扩展全部视作不可信输入,做校验过滤;
  3. 敏感数据全生命周期保护,把记忆、日志、上下文纳入安全管理;
  4. 高风险操作增加确认、拦截、审计机制,常态化安全回归测试。

五、未来发展五大趋势

  1. 安全左移,分层权责评测落地:明确大模型厂商、应用开发者、第三方工具服务商安全责任;评测嵌入 CI/CD 开发流水线,评测数据集、测试工具走向开源标准化。
  2. Agent 专属自动化红蓝对抗成为重点:针对记忆投毒、多智能体合谋、目标漂移等智能体特有风险,研发自动化红队平台,降低人工测试成本。
  3. 供应链风控升级到 “代码物料 + 语义资产” 双维度:扩展 SBOM 物料清单,将提示词模板、向量知识库、MCP 工具等语义资产纳入供应链安全审计,解决语义后门、知识库污染。
  4. 动态风险驱动的场景化分级管控替代静态评分:摒弃固定权重打分,结合业务容忍度设置风险等级,高监管行业设置红线阻断清单。
  5. 产学研政协同,三位一体治理闭环成型:构建企业自测、第三方测评、监管抽样复核的治理体系。智能体安全评测会成为贯穿全生命周期的内生安全能力,而非上线一次性合规检查,平衡创新与安全可控。
点击文后阅读原文,可获得下载资料的方法。
欢迎加入智能交通技术群!扫码进入。
点击文后阅读原文,可获得下载资料的方法。
联系方式:微信号18515441838

随机文章