当前位置:首页>排行榜>Agent评测:AI 真的会用电脑了吗?

Agent评测:AI 真的会用电脑了吗?

  • 更新时间 2026-09-17 22:27:12
Agent评测:AI 真的会用电脑了吗?

OSWorld 2.0 把考卷从 2 分钟换成 1.6 小时之后,所有模型都露馅了

九月第一周,"AI 操作电脑"这件事集中爆发了一次。

9 月 2 日,字节的豆包工作上线多 Agent 并行和 Mac 本地 GUI 操作——不用 MCP、不用 API、不用插件,纯看屏幕就能点鼠标。同一天,腾讯 WorkBuddy 开放平台上线。

9 月 4 日,OpenAI 发 GPT-6 Astra,把 computer use 写进了旗舰定义。而 Anthropic 的 Claude Computer Use,八月刚走出测试版,进到生产级。

再往前几天,腾讯、阿里、百度、字节、金山、WPS 同周扎堆发 AI 办公产品。Gartner 的报告里,代理式 AI 第一次超过生成式 AI,站上了技术成熟度曲线的顶端。

所有人都在说同一句话:AI 会用电脑了。

这话对不对,不测试下怎么知道?

一、85% 和 20.6%,是同一件事的两面

OSWorld 是 2024 年 4 月出来的,专门测 Agent 能不能操作真实电脑桌面——挖邮件、改文件、填表单、跑软件。

两年时间,这条曲线爬得很漂亮:

· 2024 年 4 月刚发布时,最好的多模态 Agent 完成率约 12%,人类基线 72%

· 2025 年 2 月,Claude 3.7 在 100 步预算下拿到 28%

· 三周后,Agent S2 用 50 步推到 34.5%

· 到 2026 年 6 月,Claude Fable 5 在 OSWorld-Verified 上拿到 85%,前三名挤在 1.6 分之内,已经越过人类

按任何合理的标准,这张考卷都饱和了。满分附近站了三个人,它就再也测不出东西了。

然后 6 月 26 日,同一个团队——港大的 XLANG Lab——发布了 OSWorld 2.0。

最强配置 Claude Opus 4.8,开满思考,500 步预算,完成率 20.6%

考卷
发布时间
最强完成率
人类基线
OSWorld 1.0
2024.04
约 85%
72.36%
OSWorld 2.0
2026.06
20.6%
72.36%

不是题目变刁钻了,也不是加了对抗样本。论文里说的意思很清楚:问题从来就没解决,是原来的题太短了。

数据来源:OSWorld 官方榜单(llm-stats.com 快照,2026.06)、OSWorld 2.0 论文 arXiv:2606.29537

二、换的不是难度,是长度

先把两代考卷的参数摆在一起看:

维度
OSWorld 1.0
OSWorld 2.0
任务数
369(公开集)
108 个端到端工作流
中位人工耗时
约 2 分钟
约 1.6 小时
Agent 平均步数
约 30 步
318 步
步数预算
50 到 100
500
每任务应用数
1.35
2.44
自建 mock 网站
0
31
评分方式
二元 pass / fail
平均 27.25 个加权检查点

中位耗时 1.6 小时,是 1.0 的 48 倍。而且 69.6% 的任务,熟练人类也要花一小时以上。

这 108 个任务是真正的工作流:报销海外差旅、准备采购申请、订行程、填签证表、做演示文稿、给视频打码、建 CAD 模型。每条任务要跨好几个应用——文件、邮箱、银行、团队聊天、浏览器,还有 LibreOffice、GIMP、Shotcut、FreeCAD、VS Code 这些桌面软件。

为了让真实网站的改版不影响评测,团队自建了 31 个 mock 网站,把邮箱、银行、团队聊天全部自己托管。

还有一个设计我很喜欢。1.0 里 Agent 被告知不许提问,自己能做多少做多少;2.0 加了模拟用户——证据缺失或者约束互相冲突的时候,Agent 可以像新员工那样去问。答什么、答到什么程度,都事先限定好了范围。

这个改动背后是论文的一个诊断:前沿模型能做好局部动作,但扛不住长流程里的约束跟踪、中途信息更新和最终核验。

数据来源:OSWorld 2.0 论文 arXiv:2606.29537 及项目页 osworld-v2.xlang.ai

三、最强模型的实际成绩单

论文跑了七个模型家族。500 步预算下的数字如下:

模型
二元完成率
部分分
每任务成本
输出 token
Claude Opus 4.820.6%
54.8%
约 $72.4
224K
Claude Opus 4.7
18.2%
48.9%
约 $33.6
150K
GPT-5.5
13.0%
49.5%
约 $25.5
37.1K
Claude Sonnet 4.6
8.3%
41.5%
MiniMax M3
4.6%
22.3%
Kimi 2.6
4.6%
22.1%
Qwen 3.7-Plus
2.8%
21.5%

说明:前三行取论文 Batch 动作模式(每步允许多次工具调用)的数据,后四行来自 Single 模式表。两种模式不可直接互比,仅看排序。

这张表里有三个反直觉的地方。

部分分和完成率,撕裂得厉害

Opus 4.8 部分分 54.8%,严格完成 20.6%。GPT-5.5 部分分 49.5%,完成只有 13.0%。

翻译一下:大部分任务它们都能做掉一半以上,然后在某个地方丢掉线索,最后收不了尾。

论文的失败分析说得很具体——Agent 会忘记任务早期定下的约束、漏掉中途进来的信息、拿不准的时候靠猜而不是去问用户、宣布完成之前不核验。四件事,全是长流程专属病。

便宜模型的部分分,能追平贵模型

GPT-5.5 花 3.7 万输出 token 拿到 49.5% 部分分,接近 Opus 4.7 的 48.9%——后者花了 15 万。但二元完成率上,GPT-5.5 是 13.0%,Opus 4.7 是 18.2%。

多烧的那些 token,买来的不是"多做几步",是把半成品收成终态的能力。而且边际成本很陡:论文算过,后期每多一个百分点的完成率,大约要多花 2.5 到 3 万 token。

批处理省下的不只是钱

Opus 4.8 用批处理大约 103 个 turn 拿到 20.6%;Opus 4.7 用单动作模式,要 318 步才 13.9%。

在真实交互部署里,turn 数直接对应延迟,也直接对应界面漂移的风险——你每多等一步,屏幕上的东西就多一点变得不一样。

四、时长本身就是一种能力

这一节是我最想让你记住的。

论文按人工预估耗时分了桶,看二元完成率怎么变:

人工耗时区间
最好的表现
45 分钟以内
20% 到 24%
137 到 163 分钟
没有模型超过 10%
超过 163 分钟
全部模型 0%

还有一个更扎心的数字:人类标注者觉得"简单"的任务里,44.4% 对 Agent 仍然困难。

原因不难理解。有些流程对人类来说简单,是因为肌肉记忆和常识——填表单的时候顺手瞄一眼页面上别的信息。Agent 没有这种"顺手"。

这个结论不是孤例。SWE-bench 上出现过的故事,Terminal-Bench 又演了一遍:Gemini 3.8 Flash 在 2.1 版能拿 89% 到 91%,到了主打长任务的 4.0 版只剩 19.1%。三十多个点的落差,掉的全是时长。

一句话:时长不是难度的倍数,时长是另一种能力。一个模型在 10 步任务上是 SOTA,不代表它在 300 步任务上及格。

数据来源:OSWorld 2.0 论文 arXiv:2606.29537;Terminal-Bench 官方榜单(2026.09 快照)

五、它们到底卡在哪:10 种挑战现象

论文给每条任务打了非互斥的"挑战现象"标签,一共十种。这个分类我建议你收藏,它比一句"Agent 不行"有用得多:

挑战现象
要求什么能力
占比
跨源推理
把邮件、文档、网站、记录里的事实对上
42.6%
视觉空间精度
精确定位、摆放、对齐,或像素级检查
41.7%
隐状态推断
恢复既不在指令里、也不在明处的状态
39.8%
多项状态跟踪
保持多行、多记录、多次编辑前后一致
39.8%
冲突消歧
判断几个过时或互相矛盾的来源哪个可信
36.1%
多模态编辑
产出或核验图像、视频、音频、CAD、医学影像
27.8%
教程跟随
从 PDF、网页教程、视频里提取流程并适配
20.4%
动态环境
执行途中收到新邮件或消息,要改计划
9.3%
流式交互
观察和动作之间,界面发生了变化
5.6%
主动交互
发现条件含糊或无效,主动问模拟用户
5.6%

占比之和超过 100%,因为一条任务可以打多个标签。

论文做了轨迹级的归因,把每条轨迹标成"撞上了并且失败"、"撞上了并且处理了"或者"根本没测到"。结果有两个清晰的模式。

一是所有模型在"隐藏状态"类现象上集体偏弱——隐状态推断、多项状态跟踪、冲突消歧、动态环境。这四种要的其实是同一件事:把不在明面上的信息找出来,并且在几百步里维持住。

二是有些标签占比低,不是因为简单,是因为 Agent 根本走不到那儿。主动交互只有 5.6%,流式交互 5.6%——很多轨迹在前面的环节就已经挂了,压根没机会碰到这两个。

论文里有个例子,一条报销任务同时踩中四种现象:先读报销指南拿到科目代码(教程跟随);凭证散在邮箱收据、银行流水、上一份报销单里(跨源推理);执行途中新邮件到了,规则变了(动态环境);证据对不上的时候应该问用户,而不是硬提交(主动交互)。

这条路,人类员工闭着眼也能走完。Agent 走不完。

六、评测方式也变了:从及格/不及格到 27 个检查点

这一块是给做评测的人看的,我觉得比榜单本身更有价值。

1.0 用的是二元 pass / fail。对两分钟的任务够用,但在长流程里,"完全没进展"和"差最后一步核验"会被打成一个分,区分度太差。

2.0 改成了:每条任务平均 27.25 个加权检查点,二元完成要求总分达到 0.995 的阈值。跑一趟会同时给你两个数——二元完成率(主指标)和部分分。

还有个细节值得抄:LLM 裁判的权重被压到 50% 以下。团队明确说,让模型当裁判,对屏幕上的视觉信息判断不够可靠,所以主要靠功能验证,模型评判只占小头。

安全部分单独做了"副作用审计"。举两个论文里的例子:Agent 推代码的时候有没有顺手泄露 .env 里的 API Key;磁盘只剩 398MB 的时候,它会不会还去下载一个 372MB 的音频,把系统撑爆。

质检有三层:自动生成单元测试,防 Agent 走捷径拿分;标注者人工重解任务,核可行性;再用前沿模型跑一遍,查奖励黑客和假阴性。

这三层其实回答了一个很实际的问题:榜单上的分是怎么来的。同一道题,检查点设计不同、判分方式不同,能差出十几个点。

还有个容易忽略的设计:任务不是让模型自动生成的。90% 的任务由内部标注团队端到端设计——先看教程和文档,自己上手软件,再从真实经验里提炼。LLM 合成的任务只当灵感来源,因为合成数据常有虚假输入、浅层拼接和奖励黑客风险。

七、回到我自己的踩坑记录:工具说成功不算数

写到这里,我想插一段自己的经历。

之前我跑 GAIA 的时候踩过一个坑,后来专门写过一篇:程序跑完了、没有报错、顶层 error 是 None,但一道题都没做对。原因是代理挂了导致搜索工具全线失败——可每一步工具调用的返回值都是"成功"。

OSWorld 2.0 让我确认了一件事:这不是我的环境问题,这是长程 Agent 评测的固有难题。

最近看到一位做 Mac GUI 自动化的开发者写的踩坑记录,几乎每一条都在说同一件事:

· 有一轮 4 次写入操作,工具全部返回成功,截图一看,前 3 次输入框是空的

· 系统设置里关蓝牙,同一个坐标点三次三种结果——第一次坐标算错点到角落,第二次坐标对了但窗口在后台收不到输入,第三次激活窗口才关掉。而三次操作的回显一模一样

· Agent办公的编辑器,辅助功能树写字进去看着成功,截图里字也在,但发送键是灰的,真点发送发出去是空消息

· Agent 跑在全屏终端里、目标应用在另一个桌面时,点击不是无效,是打到你正在用的窗口上——实测三次,工具都说点了,全戳在终端上

还有一组数据:macOSWorld 那篇论文测过,顶级模型纯视觉在 macOS 上的成功率只有四成多,是 Ubuntu 的一半

这些都指向同一个结论:在 GUI Agent 里,"工具说成功"和"事情办成了"之间的距离,比你想象的大得多。

所以做 GUI Agent 评测,核验必须看应用自己的状态——发送键亮没亮、任务进没进列表、文件落没落盘。光看到屏幕上出现了字,不算数。

这跟 OSWorld 2.0 用 27 个检查点加状态验证的思路,是同一个答案。

八、那这波发布,到底什么水平

回到开头。九月这波里,最有代表性的三家:

产品
技术路线
主打什么
明显短板
Claude Computer Use
2026.08 正式版
看截图 + 读 DOM,两条腿走路
多步界面任务串成闭环
复杂动态页面容错待打磨
GPT-6 Astra
2026.09.04
高层目标自主规划,端到端工作流
跨浏览器、代码、专业软件的完整流程
比上代快约 47%,但 API 价格涨到约 2.5 倍
豆包工作
2026.09.02
纯视觉识别,不依赖 MCP / API / 插件
本地执行 + 飞书生态 + 门槛低
跨平台一致性、复杂页面容错

这些产品的宣传数字,需要打个折看。厂商自己发的 benchmark 是"主张",不是"裁决"。

· 同一个模型的成绩,Google 的发布表里写 75.4%,官方中立榜上是 70.2% 到 70.6%。两边都没撒谎,是跑法不一样

· 有一家自报 82.8%,内部测试号称 85.6%——2.8 个点的自测溢价,人家自己在论坛上承认了

· 也有一家反过来的,自报 78.85%,中立榜复现出 82.56%,比自报还高

· 还有一家做 GUI 的模型,8 月 20 日发布,自报 MobileWorld 82.1%、MobileWorld-Real 92.2%,但它在 OSWorld 的中立榜上根本进不去——那个榜的规则是你把 agent 代码交给维护者、他们替你跑,没有 checkpoint 也没有 API,就没东西可跑

还有一件事更值得说:那个中立榜上排第一的,是一个 harness,不是模型。

榜单前 12 名里有 5 个是套着别人模型的框架。第 1 名 90.19%,第 2 名才是模型,85.96%。连榜单第一名都承认自己是脚手架,你最该关心的就不是"哪个模型最会用电脑",而是"你这套东西,在什么任务上,跑了多少步,怎么算成功的"。

数据来源:OSWorld 官方维护者榜单(2026.09 快照,共 66 条记录)、各家发布会公开材料

九、如果你要给自己的 Agent 做长程评测

从 OSWorld 2.0 身上能抄到的最实用的东西,是这五步:

第一步,把"时长"当成一个独立维度测。

别只测 10 步的任务。同一套任务,做一版短的、一版长的,或者干脆把 5 个短任务串成一条链,看完成率掉多少。OSWorld 的分桶数据告诉我们,这个落差会非常陡。

第二步,算部分分,不要只算通过率。

一个完成率 20%、部分分 55% 的 Agent,比一个完成率 25%、部分分 30% 的更有前途——前者差的是收尾,后者差的是理解。这两个问题要修的代码完全不同。

第三步,检查点按功能验证设计,别按文本匹配。

优先查状态:文件在不在、字段对不对、提交记录里有没有。LLM 裁判可以用,但权重压到一半以下,尤其是涉及画面判断的时候。

第四步,核验要看应用自己的状态。

前面那堆踩坑说得很清楚了:工具返回成功不等于成功。发送键亮没亮、任务进没进列表、文件落没落盘——这些才是证据。屏幕上有字不算。

第五步,把副作用也测一遍。

有没有泄露密钥、有没有在磁盘快满的时候还下载大文件、有没有为了完成任务删掉不该删的东西。这些在短任务里几乎测不到,在长流程里才是真风险。

十、写在最后

OSWorld 2.0 这篇论文,最容易被误读成"AI 操作电脑又不行了"。

我的理解正好相反。

1.0 饱和到 85% 的时候,其实没有人知道这些 Agent 到底能不能干活——因为考卷太短,考不出真实工作的那种"下午三点还没干完、四点半又来了封新邮件"的滋味。2.0 让分数掉回 20.6%,反而是把一个真问题摆回了台面。

论文里有一句话我很认同,大意是:前沿模型能把每一个局部动作做好,但扛不住长流程里的约束跟踪、中途更新和最终核验。

这三样东西,恰好就是"会用电脑"和"能办成事"之间的全部差距。

九月这波发布里,六巨头押注的方向没有问题——屏幕、鼠标、键盘确实是 AI 进入真实工作流最通用的入口。但从 20.6% 到 72% 这段距离,不是靠发布会跨过去的。

它得靠一个一个检查点,一步一步核验,慢慢挪过去。

附:GUI Agent 长程评测 14 项 Checklist

#
检查项
1
任务平均步数是否超过 100,如果是,单独标注为长程任务
2
是否按任务长度分桶统计,而不是只报一个总分
3
是否同时上报完成率和部分分,并解释两者的差
4
检查点是否以功能验证为主,而非文本字符串匹配
5
LLM 裁判的权重是否压到 50% 以下,尤其是视觉类判定
6
核验是否读取应用真实状态,而不是依赖工具的返回值
7
是否记录了工具报告成功但实际失败的案例
8
环境是否自建或快照固定,避免第三方页面改版影响复现
9
是否有中途注入新信息(新邮件、新消息)的动态环境用例
10
是否有"该问人时会不会问人"的主动交互用例
11
是否审计副作用:密钥泄露、异常大文件下载、误删
12
是否跑过稳定性复测(同一任务多次运行,看方差)
13
是否记录了每任务成本,而不只是准确率
14
报告里是否写清了:模型、脚手架、步数预算、判分方式

如果你也在做长程 Agent 的评测,欢迎在评论区说说你遇到的"工具说成功但没办成"的案例——这类坑,一个人踩不完。

随机文章