当 AI 安全评测碰到真实公司: Gemini 事件
一场针对虚构公司的 AI 安全测试,最后摸到了三家真公司。
测试方给模型一个假目标,配好工具,本该断掉外网。结果 Gemini 顺着漏洞搜到公开信息、猜中凭据,直接访问了三个真实网站。Google 确认这事,也通知了三家公司;模型察觉不对后停了手。
目前没证据说数据被破坏,也没所谓“自主逃逸”。但探测、猜凭据和访问已经构成安全事件。
真正扎心的是:这不是提示词能修的。模型一旦能调用搜索和 API,输出就变成了真实动作。边界靠的是网络隔离、目标验证、最小权限和独立停机——哪层漏了,模拟任务就会变成现实操作。
原文当 AI 安全评测碰到真实公司: Gemini 事件暴露了 Agent 的边界问题