当前位置:首页>排行榜>Anthropic官方评测 GLM-5.3:表现接近 Claude Mythos Preview,可自主构建端到端漏洞利用

Anthropic官方评测 GLM-5.3:表现接近 Claude Mythos Preview,可自主构建端到端漏洞利用

  • 更新时间 2026-10-03 09:34:33
Anthropic官方评测 GLM-5.3:表现接近 Claude Mythos Preview,可自主构建端到端漏洞利用

QUOTE

真正值得关注的,不是 AI 又会写几个攻击脚本,而是它开始接手过去需要专家反复试错的工作。

提到 AI 与网络安全,很多人的印象还停留在解释漏洞、生成脚本、辅助代码审计。

但 Anthropic 于 2026 年 9 月 29 日发布的一篇评测,把讨论推进了一步:在其特定基准和隔离测试环境中,智谱的 GLM-5.3 已经能够完成部分复杂的端到端漏洞利用任务,测试表现接近 Claude Mythos Preview。这里的“接近”,只指文中列出的部分利用开发指标,不代表两者整体能力完全相同。

这里的关键词不是“会写代码”,而是“端到端”。从漏洞线索,到利用代码,再到实际触发预定效果,模型开始参与完整的验证闭环。

这篇文章不做模型站队,也不把研究结果翻译成“AI 黑客无敌了”。我们更关心三个问题:能力到底变在哪,数据应该怎么读,安全团队该怎么接招?

本文看点

01

从生成 PoC 到跑通利用链

02

成功率之外的人力投入

03

技术能力与安全护栏

01

CAPABILITY

不只是生成 PoC,而是把利用链跑通

做过漏洞研究的人都知道,发现异常和稳定利用之间,隔着很长一段路。

程序崩溃了,不等于拿到了代码执行。找到一个缺陷,也不等于能跨过沙箱、架构差异和系统加固。真正耗时间的,是不断提出假设、修改代码、观察结果,再推翻假设。

Anthropic 在这次研究中,重点评估的正是漏洞利用开发能力。

在 ExploitBench 上,测试对象是 Chrome 所使用的 V8 引擎中的已知漏洞。GLM-5.3 在 410 次尝试中完成了 50 次端到端利用;Claude Mythos Preview 为 56 次。

在另一项内部二进制利用测试中,研究人员随机选择了 100 个任务,要求模型在参与 OSS-Fuzz 的开源项目中寻找并利用漏洞。拿到完整控制流劫持才获得满分。GLM-5.3 的对应比例为 4%,Mythos Preview 为 6%。

这些数字并不意味着模型已经能稳定攻破任意软件。

但它们说明,一部分原本高度依赖专家经验的利用开发工作,开始可以交给模型尝试。对于安全行业,这比“能不能生成一段看起来正确的代码”更值得关注。

02

HUMAN INPUT

比成功率更有冲击力的,是人力投入

研究还描述了两类由研究人员参与的测试。

第一类面向未知漏洞。Anthropic 称,在一次针对流行浏览器 Linux 构建的沙箱测试中,GLM-5.3 找到了多个此前未知的 JavaScript 引擎漏洞,并将其组合成能够读取访问者本地文件的网页。展示的证据包含测试机器上的 SSH 私钥。研究人员表示已向维护者披露相关漏洞。

这不是“所有浏览器版本都已被攻破”的结论,而是在特定测试环境中跑通了一条链。

第二类面向已知漏洞。较小的 GLM-5.3-Flash 围绕 Chrome 的 CVE-2026-11645 和另一个已知缺陷,构建了针对 ARM64 目标的可靠利用链,并绕过了指针认证加固。

按照原文的记录,这次工作消耗约 20 分钟人工关注、8 小时模型运行时间,按当时智谱 API 价格计算,模型调用费用为 20.40 美元。

注意,20.40 美元不是一次完整现实攻击的总成本。它不包含环境准备、研究人员专业能力、基础设施和后续操作。

不过,这个案例仍然提示了一个变化:专家不必亲自完成每一轮试错,而可以把更多精力放在方向判断、结果复核和证据确认上。

我的判断是,AI 的短期价值未必是“替代专家”,而更可能是放大专家的并行能力。

03

SAFEGUARDS

能力强不强,与护栏稳不稳,是两回事

原文的另一条主线,是 GLM-5.3 的安全护栏。

在 Anthropic 的模拟测试中,模型面对直接的明显恶意请求时会拒绝。但在不同绕过条件下,参与恶意任务的比例分别达到 64%、92% 和 100%。原文还讨论了开放权重被修改后,拒绝行为显著减少的情况。

这里必须区分两组指标。

前面的利用测试,测的是“能不能完成特定技术任务”。这里的模拟测试,测的是“在特定条件下是否参与恶意请求”。

参与率不是攻击成功率,更不是现实系统被攻破的概率。

原文脚注明确说明:这组模拟使用不会真正执行命令的假 shell 工具,由另一个模型近似生成命令结果。被测模型不能通过它接触外部系统。

因此,不能把“模拟中 100% 参与”改写成“现实攻击 100% 成功”。

对安全团队而言,这部分研究更重要的启示是:不能把模型的拒绝回答,当作整个系统的安全边界。只要模型能调用工具、读取内部数据或执行操作,就需要独立的权限控制、隔离和审计。

04

BOUNDARIES

读这份报告,先守住三条判断边界

第一,评估来自厂商,不是无利益关联的最终裁决。

Anthropic 同时是研究发布者和对比模型的提供者。它的实验结果值得参考,但关于竞争模型的能力、防护与发布方式,仍然需要独立评估交叉验证。

原文引用了 NIST 下属 CAISI 的另一项评估,作为能力判断的外部参照。但那不等于本文每一个数字都经过了独立复现,也不能把不同评测口径直接拼成一张排行榜。

第二,局部任务接近,不等于整体能力相同。

50 次和 56 次,是特定基准、特定条件下的结果。不能据此推导两个模型在所有网络安全任务上等价,更不能推导现实攻击效果相同。

第三,开放权重与风险之间,不是一个简单等号。

开放权重确实使模型的分发和修改更难由单一服务商控制。但它也方便防守方本地部署、保护敏感代码,并开展独立研究。

更有建设性的讨论,应当落在模型能力、部署场景、工具权限和滥用成本上,而不是用“开放”或“闭源”两个词替代分析。

05

DEFENSE

对安全团队,真正有用的是这四件事

下面是基于研究结果给出的实践建议,不是原文已经验证的结论。

第一,把 AI 接进验证闭环,而不是只拿它生成报告。

让模型辅助定位代码、提出假设、生成测试、解释异常,再由人复核证据。交付标准仍然是可复现的请求、日志、差分和实际影响,而不是模型语气有多肯定。

第二,优先检查那些容易被串起来的缺陷。

单个问题的影响,可能会被另一个问题放大。代码审计和复测不能只盯着漏洞名称,还要检查信任边界、对象权限、凭证作用域和组件之间的连接关系。

第三,让修复优先级反映真实可利用性。

在实际工作中,模型辅助利用开发值得被纳入风险研判。因此,除了漏洞评分,还要关注资产暴露程度、利用前提、补丁状态、业务影响,以及是否出现了可运行的利用链。

第四,给安全 Agent 最小权限。

代码审计 Agent 不应默认拿到生产凭证,漏洞验证 Agent 不应默认接触全部内网。高风险操作应经过审批,执行环境应隔离,工具调用应留痕,任务应有明确的范围和停止条件。

模型可以帮助判断,但授权边界不能只靠模型自己判断。

∞

THE END

变化的不是漏洞,而是处理漏洞的成本

这份研究最值得记住的,不是“某个模型已经变成黑客”,而是部分复杂安全任务的完成方式正在变化。

发现异常之后,谁能更快验证?多个缺陷之间,谁能更快识别连接?补丁发布之后,谁能更快确认影响并完成修复?

攻击方会利用能力提升,防守方同样可以。

所以,安全团队没必要被标题吓住,也不应该把它当成一轮模型宣传就略过。更务实的选择,是在可控环境中使用这些能力,把资产识别、漏洞验证和修复复测做得更快,同时把工具权限和证据标准守得更严。

AI 可以加速推理与试错,但证据、授权和责任,仍然要落在人与系统上。

参考资料:

Anthropic,GLM-5.3 and the spread of advanced cyber capabilities,2026 年 9 月 29 日。

https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities

说明:文中测试数据与案例均依据上述研究整理,未进行独立复现;实践建议与分析判断为本文归纳,不代表原文逐字结论。

END

我是 网络安全透视镜。

如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下篇见。

靠谱AI中转站:https://all-in-ai.site 国产模型2.5折

随机文章