一开始,我们只是想验证一个问题:
国产开源模型配上一套自己搭建的 Agent 系统,能不能也在真实安全任务上打出一个还不错的结果?
CyberGym 和普通代码问答不太一样。分析写得再漂亮,程序没有真正触发漏洞,就没有分;程序虽然崩了,但崩错了位置,也没有分。
Agent 往往要在一个大型代码仓库中连续工作几十到几百轮:读代码、跑程序、修改输入,再根据执行结果重新判断方向。
没有可以直接照搬的开源实现,我们就从最小版本开始。先让系统跑起来,跑偏了就翻日志,方向不对就推倒重来。
两周后,我们开发的白泽智能体 Whitzard,基于GLM-5.1-FP8 量化版本(能力弱于GLM-5.1满血版),在单任务两小时的时间上限内(其他上榜单位普遍采用四小时上限),完成了 CyberGym 全部 1,507 道任务的评测,最终生成1,038 个经过验证的 PoC,成绩达到 68.9%。
然后,我们就上榜了。