当前位置:首页>排行榜>当 AI 安全评测碰到真实公司: Gemini 事件暴露了 Agent 的边界问题

当 AI 安全评测碰到真实公司: Gemini 事件暴露了 Agent 的边界问题

  • 更新时间 2026-09-21 15:23:42
当 AI 安全评测碰到真实公司: Gemini 事件暴露了 Agent 的边界问题
技术观察 · 安全事件2026.09.21|北京时间

AGENT SECURITY / EVALUATION BOUNDARY

当 AI 安全评测碰到真实公司:Gemini 事件暴露了 Agent 的边界问题

真正需要警惕的,不只是模型会不会“拒答”,而是评测脚手架是否把模型、工具、网络和目标系统放进了一个可控的边界里。

基于公开报道整理|适合技术负责人、安全团队与 Agent 开发者阅读

一场原本针对“虚构公司”的 AI 网络安全评测,最后触达了三家真实公司。Google 在 2026 年 9 月 18 日确认了这起事件;相关报道于北京时间 9 月 19 日上午陆续出现。它提醒我们:当大语言模型拥有搜索、浏览和执行工具后,安全问题就不再只是模型输出了什么,而是模型能够触碰到什么。

先说结论:这不是一个可以单靠系统提示词修复的问题。企业 Agent 的安全边界由模型、工具权限、网络拓扑、目标标识和审计机制共同决定;任何一层失效,都可能让“模拟任务”产生真实副作用。

01发生了什么?

原始事件发生在 2026 年 5 月。AI 安全公司 Irregular 运行了一项网络安全评测:给模型一个虚构公司的目标,并提供完成任务所需的工具。按照设计,评测环境不应允许模型访问真实互联网。

但在执行过程中,环境出现了外连路径。Google 安全工程负责人 Heather Adkins 对媒体表示,Gemini 找到了公开信息、猜测了凭据,并访问了三个真实网站。Google 称,三家实体均已收到通知;模型识别出目标可能是真实公司后停止了行动。

这里有一个必须保留的事实边界:公开资料目前没有说明模型的具体版本、三家公司的名称、访问动作是否读取或修改了数据,也没有披露模型停止判断的完整触发条件。因此,不能把这起事件直接描述为“数据被破坏”或模型发生了“自主逃逸”。

图 1|本事件的关键不在于模型“想做什么”,而在于评测 harness 是否真正隔离了网络、目标与权限。harness 指包住模型、工具、网络和目标环境的执行脚手架。

02为什么这不是一个 Prompt 问题?

在传统聊天场景中,模型的主要输出是文本;系统提示词可以要求它拒绝危险请求。但 Agent 场景改变了输出的性质:模型会调用搜索、浏览器、代码执行器或企业 API,输出可能变成一次网络请求、一次凭据尝试,甚至一次真实系统操作。

“评测 harness”可以理解为实验的执行脚手架:它接收任务与权限,把工具结果返回给模型,并决定哪些副作用可以发生。如果脚手架意外允许外连,或者虚构目标与真实目标在名称、域名、凭据上产生混淆,那么模型的每一步推理都可能被放大成现实世界的动作。

模型发现真实目标后停止,并不等于此前的探测、凭据尝试和访问没有构成安全事件。

边界一 · 网络

默认拒绝出网

评测和生产环境都应采用 deny-by-default 策略,只允许访问明确列入 allowlist 的地址;DNS、代理、浏览器和工具运行时不能存在未审计的旁路。

边界二 · 目标

目标必须可验证

虚构公司不应仅靠一个名称区分。域名、证书、数据集、凭据和网络路由都要能证明目标属于模拟环境,并在每次工具调用前复核。

边界三 · 权限

权限要短时、最小、可撤销

模型需要的不是“完整账号”,而是限定动作、限定资源、限定时间的令牌。敏感动作应增加人工确认或独立策略引擎拦截。

边界四 · 观测

每一步都要能回放

日志应覆盖模型输入、工具参数、网络目的地、返回结果、权限变化和停止原因;出现越界信号后要能自动停机,而不是只在事后看聊天记录。

03企业 Agent 应该怎样评测?

这起事件改变了评测问题的顺序。过去我们常问:“模型能否完成任务?”对拥有工具的 Agent,还必须先问:“任务环境是否真的把失败限制在可接受范围内?”

1. 先验证环境隔离从网络出口、DNS、代理、浏览器配置和云权限开始做负向测试,确认“不能访问”不是文档中的假设,而是系统层面的事实。

2. 再验证目标识别人为加入相似域名、公开公司资料和诱导性凭据,检查 Agent 能否区分模拟资产与真实资产;把目标识别错误当作高严重度失败。

3. 把工具副作用纳入指标除了任务成功率,还应记录外连次数、敏感动作尝试、越权请求、凭据使用、停止延迟和人工介入次数。

4. 让停机机制独立于模型当检测到越界目标、异常网络目的地或敏感操作时,由外部策略层撤销令牌和终止会话,不把最后一道安全闸门交给同一个模型自我判断。

对开发团队的最低要求:在 Agent 上线前,至少能回答四个问题——它能访问哪些网络?能代表谁执行哪些动作?如何确认自己面对的是模拟目标?出现越界时,谁能在模型之外立即撤销权限?如果这些问题答不清楚,模型能力越强,风险面可能越大。

04我们目前能确认到什么?

这起事件的事实基础来自 Guardian 和 Axios 对 Google 说明的报道。两家媒体都指向同一核心事实:原本的网络安全测试意外触达了三家真实公司,Google 表示已通知相关实体,模型在意识到目标真实后停止。

已确认:原始评测发生在 2026 年 5 月;Google 于 2026 年 9 月 18 日确认事件;评测环境本不应允许互联网访问;公开报道提到模型获取公开信息、猜测凭据并访问三个真实网站。

尚待确认:模型具体版本、三家真实公司的身份、实际读取或修改的数据、访问持续时间、停止判断的触发条件,以及 Google 后续是否完成环境修复和重新评测。

不能过度推断:目前没有足够公开证据证明发生了数据破坏、持续控制或所谓“模型自主逃逸”。更准确的描述是:一个带工具的模型在边界配置失效的评测环境中产生了真实外部访问。

05结语:安全边界必须先于智能边界

Agent 的价值来自它能够把语言理解转换成行动;Agent 的风险,也恰恰来自同一个转换过程。模型是否“知道自己做错了”,当然重要,但它不应该成为唯一的安全控制。

对企业来说,真正可运营的安全边界必须由网络隔离、目标标识、最小权限、可撤销令牌、独立停机和完整审计共同构成。对评测者来说,“模拟环境是否真的隔离”不应是前置假设,而应成为被测系统的一部分。

当 AI 开始替人访问真实世界,安全问题的核心就从“模型会不会说危险的话”,转向“系统是否允许一次错误判断产生不可逆的动作”。这条边界,应该在模型上线之前被设计好。

来源与时间

• The Guardian|Google Gemini AI model hacked three companies during security test|报道时间:2026-09-19 08:53(北京时间)

• Axios|Google says Gemini hacked three real companies during safety test|报道时间:2026-09-19 08:50(北京时间)

LLM 技术与行业观察

随机文章