OSWorld 2.0 把考卷从 2 分钟换成 1.6 小时之后,所有模型都露馅了
九月第一周,"AI 操作电脑"这件事集中爆发了一次。
9 月 2 日,字节的豆包工作上线多 Agent 并行和 Mac 本地 GUI 操作——不用 MCP、不用 API、不用插件,纯看屏幕就能点鼠标。同一天,腾讯 WorkBuddy 开放平台上线。
9 月 4 日,OpenAI 发 GPT-6 Astra,把 computer use 写进了旗舰定义。而 Anthropic 的 Claude Computer Use,八月刚走出测试版,进到生产级。
再往前几天,腾讯、阿里、百度、字节、金山、WPS 同周扎堆发 AI 办公产品。Gartner 的报告里,代理式 AI 第一次超过生成式 AI,站上了技术成熟度曲线的顶端。
所有人都在说同一句话:AI 会用电脑了。
这话对不对,不测试下怎么知道?
一、85% 和 20.6%,是同一件事的两面
OSWorld 是 2024 年 4 月出来的,专门测 Agent 能不能操作真实电脑桌面——挖邮件、改文件、填表单、跑软件。
两年时间,这条曲线爬得很漂亮:
· 2024 年 4 月刚发布时,最好的多模态 Agent 完成率约 12%,人类基线 72%
· 2025 年 2 月,Claude 3.7 在 100 步预算下拿到 28%
· 三周后,Agent S2 用 50 步推到 34.5%
· 到 2026 年 6 月,Claude Fable 5 在 OSWorld-Verified 上拿到 85%,前三名挤在 1.6 分之内,已经越过人类
按任何合理的标准,这张考卷都饱和了。满分附近站了三个人,它就再也测不出东西了。
然后 6 月 26 日,同一个团队——港大的 XLANG Lab——发布了 OSWorld 2.0。
最强配置 Claude Opus 4.8,开满思考,500 步预算,完成率 20.6%。
| | | |
|---|
| OSWorld 1.0 | | | |
| OSWorld 2.0 | | 20.6% | |
不是题目变刁钻了,也不是加了对抗样本。论文里说的意思很清楚:问题从来就没解决,是原来的题太短了。
数据来源:OSWorld 官方榜单(llm-stats.com 快照,2026.06)、OSWorld 2.0 论文 arXiv:2606.29537
二、换的不是难度,是长度
先把两代考卷的参数摆在一起看:
| | |
|---|
| 任务数 | | |
| 中位人工耗时 | | 约 1.6 小时 |
| Agent 平均步数 | | 318 步 |
| 步数预算 | | |
| 每任务应用数 | | |
| 自建 mock 网站 | | |
| 评分方式 | | |
中位耗时 1.6 小时,是 1.0 的 48 倍。而且 69.6% 的任务,熟练人类也要花一小时以上。
这 108 个任务是真正的工作流:报销海外差旅、准备采购申请、订行程、填签证表、做演示文稿、给视频打码、建 CAD 模型。每条任务要跨好几个应用——文件、邮箱、银行、团队聊天、浏览器,还有 LibreOffice、GIMP、Shotcut、FreeCAD、VS Code 这些桌面软件。
为了让真实网站的改版不影响评测,团队自建了 31 个 mock 网站,把邮箱、银行、团队聊天全部自己托管。
还有一个设计我很喜欢。1.0 里 Agent 被告知不许提问,自己能做多少做多少;2.0 加了模拟用户——证据缺失或者约束互相冲突的时候,Agent 可以像新员工那样去问。答什么、答到什么程度,都事先限定好了范围。
这个改动背后是论文的一个诊断:前沿模型能做好局部动作,但扛不住长流程里的约束跟踪、中途信息更新和最终核验。
数据来源:OSWorld 2.0 论文 arXiv:2606.29537 及项目页 osworld-v2.xlang.ai
三、最强模型的实际成绩单
论文跑了七个模型家族。500 步预算下的数字如下:
| | | | |
|---|
| Claude Opus 4.8 | 20.6% | | | |
| | | | |
| | | | 37.1K |
| | | | |
| | | | |
| | | | |
| | | | |
说明:前三行取论文 Batch 动作模式(每步允许多次工具调用)的数据,后四行来自 Single 模式表。两种模式不可直接互比,仅看排序。
这张表里有三个反直觉的地方。
部分分和完成率,撕裂得厉害
Opus 4.8 部分分 54.8%,严格完成 20.6%。GPT-5.5 部分分 49.5%,完成只有 13.0%。
翻译一下:大部分任务它们都能做掉一半以上,然后在某个地方丢掉线索,最后收不了尾。
论文的失败分析说得很具体——Agent 会忘记任务早期定下的约束、漏掉中途进来的信息、拿不准的时候靠猜而不是去问用户、宣布完成之前不核验。四件事,全是长流程专属病。
便宜模型的部分分,能追平贵模型
GPT-5.5 花 3.7 万输出 token 拿到 49.5% 部分分,接近 Opus 4.7 的 48.9%——后者花了 15 万。但二元完成率上,GPT-5.5 是 13.0%,Opus 4.7 是 18.2%。
多烧的那些 token,买来的不是"多做几步",是把半成品收成终态的能力。而且边际成本很陡:论文算过,后期每多一个百分点的完成率,大约要多花 2.5 到 3 万 token。
批处理省下的不只是钱
Opus 4.8 用批处理大约 103 个 turn 拿到 20.6%;Opus 4.7 用单动作模式,要 318 步才 13.9%。
在真实交互部署里,turn 数直接对应延迟,也直接对应界面漂移的风险——你每多等一步,屏幕上的东西就多一点变得不一样。
四、时长本身就是一种能力
这一节是我最想让你记住的。
论文按人工预估耗时分了桶,看二元完成率怎么变:
还有一个更扎心的数字:人类标注者觉得"简单"的任务里,44.4% 对 Agent 仍然困难。
原因不难理解。有些流程对人类来说简单,是因为肌肉记忆和常识——填表单的时候顺手瞄一眼页面上别的信息。Agent 没有这种"顺手"。
这个结论不是孤例。SWE-bench 上出现过的故事,Terminal-Bench 又演了一遍:Gemini 3.8 Flash 在 2.1 版能拿 89% 到 91%,到了主打长任务的 4.0 版只剩 19.1%。三十多个点的落差,掉的全是时长。
一句话:时长不是难度的倍数,时长是另一种能力。一个模型在 10 步任务上是 SOTA,不代表它在 300 步任务上及格。
数据来源:OSWorld 2.0 论文 arXiv:2606.29537;Terminal-Bench 官方榜单(2026.09 快照)
五、它们到底卡在哪:10 种挑战现象
论文给每条任务打了非互斥的"挑战现象"标签,一共十种。这个分类我建议你收藏,它比一句"Agent 不行"有用得多:
| | |
|---|
| 跨源推理 | | |
| 视觉空间精度 | | |
| 隐状态推断 | | |
| 多项状态跟踪 | | |
| 冲突消歧 | | |
| 多模态编辑 | | |
| 教程跟随 | | |
| 动态环境 | | |
| 流式交互 | | |
| 主动交互 | | |
占比之和超过 100%,因为一条任务可以打多个标签。
论文做了轨迹级的归因,把每条轨迹标成"撞上了并且失败"、"撞上了并且处理了"或者"根本没测到"。结果有两个清晰的模式。
一是所有模型在"隐藏状态"类现象上集体偏弱——隐状态推断、多项状态跟踪、冲突消歧、动态环境。这四种要的其实是同一件事:把不在明面上的信息找出来,并且在几百步里维持住。
二是有些标签占比低,不是因为简单,是因为 Agent 根本走不到那儿。主动交互只有 5.6%,流式交互 5.6%——很多轨迹在前面的环节就已经挂了,压根没机会碰到这两个。
论文里有个例子,一条报销任务同时踩中四种现象:先读报销指南拿到科目代码(教程跟随);凭证散在邮箱收据、银行流水、上一份报销单里(跨源推理);执行途中新邮件到了,规则变了(动态环境);证据对不上的时候应该问用户,而不是硬提交(主动交互)。
这条路,人类员工闭着眼也能走完。Agent 走不完。
六、评测方式也变了:从及格/不及格到 27 个检查点
这一块是给做评测的人看的,我觉得比榜单本身更有价值。
1.0 用的是二元 pass / fail。对两分钟的任务够用,但在长流程里,"完全没进展"和"差最后一步核验"会被打成一个分,区分度太差。
2.0 改成了:每条任务平均 27.25 个加权检查点,二元完成要求总分达到 0.995 的阈值。跑一趟会同时给你两个数——二元完成率(主指标)和部分分。
还有个细节值得抄:LLM 裁判的权重被压到 50% 以下。团队明确说,让模型当裁判,对屏幕上的视觉信息判断不够可靠,所以主要靠功能验证,模型评判只占小头。
安全部分单独做了"副作用审计"。举两个论文里的例子:Agent 推代码的时候有没有顺手泄露 .env 里的 API Key;磁盘只剩 398MB 的时候,它会不会还去下载一个 372MB 的音频,把系统撑爆。
质检有三层:自动生成单元测试,防 Agent 走捷径拿分;标注者人工重解任务,核可行性;再用前沿模型跑一遍,查奖励黑客和假阴性。
这三层其实回答了一个很实际的问题:榜单上的分是怎么来的。同一道题,检查点设计不同、判分方式不同,能差出十几个点。
还有个容易忽略的设计:任务不是让模型自动生成的。90% 的任务由内部标注团队端到端设计——先看教程和文档,自己上手软件,再从真实经验里提炼。LLM 合成的任务只当灵感来源,因为合成数据常有虚假输入、浅层拼接和奖励黑客风险。
七、回到我自己的踩坑记录:工具说成功不算数
写到这里,我想插一段自己的经历。
之前我跑 GAIA 的时候踩过一个坑,后来专门写过一篇:程序跑完了、没有报错、顶层 error 是 None,但一道题都没做对。原因是代理挂了导致搜索工具全线失败——可每一步工具调用的返回值都是"成功"。
OSWorld 2.0 让我确认了一件事:这不是我的环境问题,这是长程 Agent 评测的固有难题。
最近看到一位做 Mac GUI 自动化的开发者写的踩坑记录,几乎每一条都在说同一件事:
· 有一轮 4 次写入操作,工具全部返回成功,截图一看,前 3 次输入框是空的
· 系统设置里关蓝牙,同一个坐标点三次三种结果——第一次坐标算错点到角落,第二次坐标对了但窗口在后台收不到输入,第三次激活窗口才关掉。而三次操作的回显一模一样
· Agent办公的编辑器,辅助功能树写字进去看着成功,截图里字也在,但发送键是灰的,真点发送发出去是空消息
· Agent 跑在全屏终端里、目标应用在另一个桌面时,点击不是无效,是打到你正在用的窗口上——实测三次,工具都说点了,全戳在终端上
还有一组数据:macOSWorld 那篇论文测过,顶级模型纯视觉在 macOS 上的成功率只有四成多,是 Ubuntu 的一半。
这些都指向同一个结论:在 GUI Agent 里,"工具说成功"和"事情办成了"之间的距离,比你想象的大得多。
所以做 GUI Agent 评测,核验必须看应用自己的状态——发送键亮没亮、任务进没进列表、文件落没落盘。光看到屏幕上出现了字,不算数。
这跟 OSWorld 2.0 用 27 个检查点加状态验证的思路,是同一个答案。
八、那这波发布,到底什么水平
回到开头。九月这波里,最有代表性的三家:
| | | |
|---|
Claude Computer Use 2026.08 正式版 | | | |
GPT-6 Astra 2026.09.04 | | | 比上代快约 47%,但 API 价格涨到约 2.5 倍 |
豆包工作 2026.09.02 | | | |
这些产品的宣传数字,需要打个折看。厂商自己发的 benchmark 是"主张",不是"裁决"。
· 同一个模型的成绩,Google 的发布表里写 75.4%,官方中立榜上是 70.2% 到 70.6%。两边都没撒谎,是跑法不一样
· 有一家自报 82.8%,内部测试号称 85.6%——2.8 个点的自测溢价,人家自己在论坛上承认了
· 也有一家反过来的,自报 78.85%,中立榜复现出 82.56%,比自报还高
· 还有一家做 GUI 的模型,8 月 20 日发布,自报 MobileWorld 82.1%、MobileWorld-Real 92.2%,但它在 OSWorld 的中立榜上根本进不去——那个榜的规则是你把 agent 代码交给维护者、他们替你跑,没有 checkpoint 也没有 API,就没东西可跑
还有一件事更值得说:那个中立榜上排第一的,是一个 harness,不是模型。
榜单前 12 名里有 5 个是套着别人模型的框架。第 1 名 90.19%,第 2 名才是模型,85.96%。连榜单第一名都承认自己是脚手架,你最该关心的就不是"哪个模型最会用电脑",而是"你这套东西,在什么任务上,跑了多少步,怎么算成功的"。
数据来源:OSWorld 官方维护者榜单(2026.09 快照,共 66 条记录)、各家发布会公开材料
九、如果你要给自己的 Agent 做长程评测
从 OSWorld 2.0 身上能抄到的最实用的东西,是这五步:
第一步,把"时长"当成一个独立维度测。
别只测 10 步的任务。同一套任务,做一版短的、一版长的,或者干脆把 5 个短任务串成一条链,看完成率掉多少。OSWorld 的分桶数据告诉我们,这个落差会非常陡。
第二步,算部分分,不要只算通过率。
一个完成率 20%、部分分 55% 的 Agent,比一个完成率 25%、部分分 30% 的更有前途——前者差的是收尾,后者差的是理解。这两个问题要修的代码完全不同。
第三步,检查点按功能验证设计,别按文本匹配。
优先查状态:文件在不在、字段对不对、提交记录里有没有。LLM 裁判可以用,但权重压到一半以下,尤其是涉及画面判断的时候。
第四步,核验要看应用自己的状态。
前面那堆踩坑说得很清楚了:工具返回成功不等于成功。发送键亮没亮、任务进没进列表、文件落没落盘——这些才是证据。屏幕上有字不算。
第五步,把副作用也测一遍。
有没有泄露密钥、有没有在磁盘快满的时候还下载大文件、有没有为了完成任务删掉不该删的东西。这些在短任务里几乎测不到,在长流程里才是真风险。
十、写在最后
OSWorld 2.0 这篇论文,最容易被误读成"AI 操作电脑又不行了"。
我的理解正好相反。
1.0 饱和到 85% 的时候,其实没有人知道这些 Agent 到底能不能干活——因为考卷太短,考不出真实工作的那种"下午三点还没干完、四点半又来了封新邮件"的滋味。2.0 让分数掉回 20.6%,反而是把一个真问题摆回了台面。
论文里有一句话我很认同,大意是:前沿模型能把每一个局部动作做好,但扛不住长流程里的约束跟踪、中途更新和最终核验。
这三样东西,恰好就是"会用电脑"和"能办成事"之间的全部差距。
九月这波发布里,六巨头押注的方向没有问题——屏幕、鼠标、键盘确实是 AI 进入真实工作流最通用的入口。但从 20.6% 到 72% 这段距离,不是靠发布会跨过去的。
它得靠一个一个检查点,一步一步核验,慢慢挪过去。
附:GUI Agent 长程评测 14 项 Checklist
| |
|---|
| 任务平均步数是否超过 100,如果是,单独标注为长程任务 |
| |
| |
| |
| LLM 裁判的权重是否压到 50% 以下,尤其是视觉类判定 |
| |
| |
| 环境是否自建或快照固定,避免第三方页面改版影响复现 |
| 是否有中途注入新信息(新邮件、新消息)的动态环境用例 |
| |
| |
| |
| |
| 报告里是否写清了:模型、脚手架、步数预算、判分方式 |
如果你也在做长程 Agent 的评测,欢迎在评论区说说你遇到的"工具说成功但没办成"的案例——这类坑,一个人踩不完。