同一个 Agent 核心穿过不同框架后,任务轨迹走向完全不同
同一个大模型,换一套 Agent 框架,成绩能差多少?UniClawBench 给出的答案是:足以改变我们对模型能力的判断。
它没有再造一批“问完就结束”的题,而是把 Agent 放进浏览器、终端、桌面应用和本地文件系统,让它在真实工具里连续干活。结果很直接:最好的模型总体通过率也没到 50%,而框架设计常常决定模型的能力能不能真正落到任务上。
- 论文:UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks
- 作者:Zhekai Chen、Chengqi Duan、Kaiyue Sun、Bohao Li、Yuqing Wang、Manyuan Zhang、Xihui Liu
- 机构
- 发表时间
- 论文链接
- 代码与任务
一张排行榜藏着三个变量
传统 benchmark 很容易给人一种错觉:题目固定、分数确定,于是排行榜上的差距就是模型能力的差距。
到了 Agent,这个等式不再成立。模型并不是直接面对题目,它要经过一整套执行系统:上下文如何保存、工具怎么暴露、任务如何切分、失败后能不能恢复、多个子 Agent 怎样交接。模型像发动机,Agent 框架则是变速箱、底盘和控制系统。只测整车圈速,却把差异都归到发动机身上,结论自然会失真。
UniClawBench 的核心价值,就在于把三个变量分开摆上桌面:基础模型、Agent 框架,以及多轮反馈后的恢复能力。
图1:UniClawBench 的五类能力、三角色评测流程和主要发现图中左侧是五类能力,中间是闭环评测,右侧则把模型与框架组合后的能力轮廓画在一起。论文真正想测的不是“能不能给出一个像样答案”,而是 Agent 能否在真实环境里留下足够证据,并把任务完整交付。
400 个任务,不按行业分,按失败原因分
这套 benchmark 一共包含 400 个中英文任务。五类能力各有 40 个英文任务和 40 个中文任务:
- 技能使用:能否找到、读懂并正确调用指定工具或 API,例如 OCR、SQLite、Git、Docker、表格处理和文档转换。
- 探索:面对不完整甚至误导性的信息,能否排除错误路径、查证来源并留下审计记录。
- 长上下文推理:能否跨网页、PDF、邮件、日志和长轨迹维持约束一致,而不是读到后面忘了前面。
- 多模态理解:任务结果是否真正依赖图片、视频或音频证据,而非靠文件名和文字猜测。
- 跨平台协同:能否在浏览器、终端、桌面 GUI、日历、Zotero、Obsidian 等应用之间搬运状态并验证副作用。
这套分类比“办公”“旅行”“购物”更有诊断价值。一个购物任务失败,可能是没看懂图片,也可能是忘了预算约束;按场景归类只能告诉你它失败了,按能力瓶颈归类才有机会告诉你为什么失败。
不过,这种分类并不天然客观。真实任务往往同时调用多种能力,作者只能把任务归到“最主要的瓶颈”。UniClawBench 用人工设计尽量控制其他变量,但五类能力之间仍不可能完全正交。
让评审知道答案,又不让“用户”泄题
真实环境评测有两个麻烦。
第一个是答案会变。商品价格、网页内容、API 返回值都可能更新,预先录好的标准答案很快过期。
第二个是用户反馈可能泄题。如果模拟用户知道隐藏 rubric,它一句“你漏了第三张截图”,就等于把评分点送给了被测 Agent。
UniClawBench 因此设计了三个隔离角色:
- Executor
- Supervisor 是隐藏评审,可以读取完整轨迹、产物、私有参考答案和逐步评分点。
- User Simulator 模拟真实用户,但只能看到公开轨迹,以及 pass、fail、continue 这类粗粒度进度信号。
Supervisor 的详细理由不会传给 User Simulator;反馈在返回 Executor 前还会再做一次清洗。它像一道信息防火墙:评审可以知道正确答案,用户模拟器却不能借反馈把答案漏出去。
图2:三角色闭环评测。隐藏 Supervisor 评分,User Simulator 只接收粗粒度状态每项任务最多经历初始执行和两轮追加反馈。标准任务总时限 30 分钟,长上下文任务放宽到 45 分钟;一次运行平均耗时约 17.4 分钟。评测既看最终是否通过,也看逐 checkpoint 的平均完成度。
这两个指标缺一不可。只看通过率,会把“完成了九成但最后一步失败”和“几乎没开始”都记成零;只看完成度,又可能掩盖 Agent 长期停留在半成品状态。
最好的模型,也经常死在最后一公里
在统一使用 OpenClaw 的条件下,论文测试了 10 个模型。总体通过率最高的是 Claude Opus 4.8,为 47.5%;Claude Sonnet 4.6 为 45.5%;GPT-5.4 为 40.7%。
但平均完成度最高的是 GPT-5.4,达到 0.774。也就是说,它经常推进得很深,却没有把所有硬性要求关掉。这正是论文所说的“halfway failure”:Agent 会查资料、会调工具、会生成部分产物,却在长执行链里留下一个不可恢复的错误,最终仍然不能交付。
图3:十个模型在统一 OpenClaw 框架下的五类能力表现能力分布也很不均衡。多数模型在探索任务上相对最好,例如 Gemini 3.1 Pro 的探索通过率达到 85.0%;到了多模态、长上下文和跨平台协同,成绩明显下滑。即便表现最好的组合,多模态通过率也只有 21.2%,长上下文最高 43.8%,跨平台最高 38.8%。
这组数字校准了一个常见判断:Agent 现在最缺的已经不只是“会不会调用工具”。局部工具调用和信息搜索正在变得可用,真正拖后腿的是长链一致性、非文本证据落地,以及跨应用状态管理。
换一个框架,同一个模型就像换了一套能力
论文把 GPT-5.4、Claude Opus 4.8 和 Kimi 2.6 分别装进 OpenClaw、EDICT 和 Nanobot。
三组模型里,OpenClaw 的总体通过率都最高:
- GPT-5.4:OpenClaw 40.7%,EDICT 33.8%,Nanobot 29.0%;
- Claude Opus 4.8:OpenClaw 47.5%,EDICT 41.5%,Nanobot 38.5%;
- Kimi 2.6:OpenClaw 36.2%,EDICT 32.0%,Nanobot 27.8%。
作者把差异归因于三种架构的执行方式。OpenClaw 是集中式单 Agent 路径,任务约束、工具证据和反馈留在统一轨迹中,信息损失较少。EDICT 的多 Agent 编排存在“协调摩擦”:子 Agent 交接丢状态,编排器又可能亲自做掉本应分配的工作。Nanobot 最省 token,但轻量上下文管理更容易丢失细粒度证据。
图4:同一模型跨框架的成绩、token 成本,以及三轮反馈后的性能变化成本差异同样明显。以 GPT-5.4 为例,Nanobot 每个任务平均使用约 0.57M 输入 token,OpenClaw 为 1.15M,EDICT 则达到 1.68M。轻量框架确实更便宜,但便宜不等于更能完成任务;多 Agent 编排也可能同时付出更高 token 成本和更低成功率。
这里需要对论文的口号稍微降温。作者说“框架选择比模型选择影响更大”,在部分能力维度和固定模型对比中确实有证据,但不能泛化成模型不重要。同一 OpenClaw 下,10 个模型的总体通过率仍从 15.2% 拉开到 47.5%。更准确的说法是:Agent 成绩是模型与框架的联合属性,任何只报模型名、不报 harness 和配置的排行榜都不完整。
多给两次反馈,救回了一部分任务
三角色闭环并非只是一种漂亮的系统设计。随着反馈轮次增加,平均通过率从第一轮的 23.8%,提升到第二轮的 29.5%,第三轮达到 31.7%;平均累计最高分也从 0.565 升到 0.679。
附录里的案例更具体:Agent 第一轮在美国国会图书馆任务上得到 0.65,第二轮没有简单修补文件,而是从 item-level JSON 重建流程,最终达到 0.96,并顺手发现两个用户反馈没有点明的问题。
这说明恢复能力本身应该被测。单轮 benchmark 会把“第一次没做对、但听完反馈能彻底修正”的 Agent 和“完全不会做”的 Agent 放在同一个失败桶里。
它比 WebArena、OSWorld 和 ClawBench 多测了什么
WebArena 的突破,是构建可复现的功能性网站环境;它擅长测 Web 操作,但为了稳定性使用自托管站点。
OSWorld 把范围扩展到真实操作系统和跨应用任务,并使用执行式检查器验收结果;其重点仍是固定初始状态下的电脑操作。
ClawBench 更进一步,直接在 144 个生产网站上测试 153 个日常任务,通过拦截最终提交请求来避免真实副作用。它解决了“沙箱和真实网站差太远”的问题,但主要还是场景驱动、端到端的单轮完成评测。
UniClawBench 的增量不是简单把任务数加到 400,而是同时加入三件事:按能力瓶颈分类、隐藏评分标准下的多轮用户反馈,以及跨框架对照实验。它更像一台诊断仪,而不仅是一张总榜。
证据够用,但还谈不上最终裁决
自动评审是否可信,是这类 benchmark 绕不开的问题。作者抽取 50 条轨迹,让三位人类专家独立评分。Supervisor 的二元通过判断与人类多数票一致率为 92%;连续完成度与人类评分的 Pearson 相关系数为 0.71,Spearman 为 0.68。
这足以说明自动评分不是随意打分,却还不足以证明它在全部 400 个任务和所有模型上都稳定。50 条轨迹样本偏小,连续分数相关性属于较强但并不完美;Supervisor 又由 GPT-5.4 Codex 担任,潜在的模型家族偏好和判断漂移仍需独立评审器复核。
还有三条边界不能略过:
- 400 个任务全部人工设计,覆盖面不错,但离开放世界的任务分布仍然很远;
- live web 带来真实性,也带来网页更新、服务不可用和难以完全复现的问题;
- 论文没有通过大量重复运行和置信区间充分展示 Agent 随机性的影响,单次运行排名需要谨慎阅读。
开源代码、任务定义、隐藏 rubric 格式和端到端案例提升了可复现性,但真正复跑整套实验并不便宜:400 个任务、平均每项 17.4 分钟,外加高 token 消耗和多个评审 Agent,这会限制第三方的大规模验证。
下一代 Agent 评测,必须连“车架”一起报
UniClawBench 最有价值的判断,不是 Claude Opus 4.8 暂时排在第一,也不是 OpenClaw 赢了三组对照。
它真正测清的是:当任务从回答问题变成跨工具、跨模态、跨应用的长期执行后,模型能力不会自动变成可靠交付。中间那套框架如何保存上下文、组织轨迹、传递反馈和控制成本,已经成为能力本身的一部分。
以后再看到 Agent 榜单,至少应该追问四件事:用的是什么模型,装在什么框架里,允许几轮反馈,最终分数是一次性答对,还是靠多轮恢复得到。少报任何一项,那个数字都只讲了一半故事。