Agent 安全评测4 类攻击面
Agent 的安全问题,量级完全变了。聊天机器人说错话还能撤回,Agent 做错事收不回来——发出去的邮件退不回,删掉的数据没备份,转走的账款追不回。
攻击面也跟着变宽。它会读网页、读文档、读邮件,这些外部内容里能藏指令,用户从头到尾不知情。更麻烦的是它拿到的 API Key 通常有写权限,一旦被诱导调用,后果等同于内部人员误操作。
所以安全评测不能只当内容审核来做,得管住权限和动作。提示注入靠输入隔离,越权靠权限最小化,数据外泄靠出口管控,危险动作必须加人工确认闸门。
真正难防的是间接注入。比如让它总结一份合同,页面底部藏着白色字体指令,要求把对话上下文发到外部地址,它就照做了。防御上,外部内容一律视为不可信输入,处理时禁用高风险工具,并对参数做出口扫描。
越权的根因通常是权限给多了。为了省事给它一个全权限 Key,再在 prompt 里写“只能查自己的数据”,这是把安全边界建在话术上。正确的做法是按任务发最小权限的临时凭证,在工具层做硬隔离。
删除、转账、群发这类高危动作,必须默认挂起等人确认。确认界面要显示完整金额和收件人列表,还得留个可撤销的窗口期。
红队测试也得常态化。每次发版跑全量安全用例,失败就阻断流水线;线上拦截的异常调用自动进样本库;每季度再搞一次人工演练,专门找机器想不到的组合。
Agent 的安全边界要建在权限和系统上,不能建在提示词里。
原文Agent 安全评测4 类攻击面