数据日期:2026-08-20
什么是 AA-Briefcase?
AA-Briefcase 是 Artificial Analysis 开发的 Agent 能力评测基准,模拟真实知识工作场景,测试模型在长程任务中的 Agent 能力。
四大评测方向:
每轮任务包含 91 个子任务,模型需交付电子表格、演示文稿、备忘录等真实工作成果。结果由三个维度综合评分:
- Rubric 通过率
- 分析质量 Elo
- 呈现质量 Elo
综合指标 AA-Briefcase Elo 越高,说明模型在真实工作中的 Agent 能力越强。
排行榜(2026年8月)
AA-Briefcase 已评测 62 个模型,当前前 20 名如下(按 Elo 降序):
| | |
|---|
| | 1714 |
| | 1689 |
| | 1607 |
| | 1578 |
| Claude Fable 5 (with fallback) | 1574 |
| | 1543 |
| | 1503 |
| | 1469 |
| | 1421 |
| | 1384 |
| | 1358 |
| | 1340 |
| | 1313 |
| | 1292 |
| DeepSeek V4 Flash 0731 (max) | 1285 |
| | 1276 |
| | 1252 |
| | 1225 |
| | 1193 |
| | 1150 |
榜单特点
Anthropic 占据主导地位。 Claude Opus 5 的 max / xhigh / high / medium 四个档位包揽排行榜前 8 名中的 4 席,加上 Fable 5、Sonnet 5 各两个档位,Anthropic 在前 16 名中占据 8 个位置,在 Agent 任务上的综合表现突出。
Grok 4.6 位居第 4。 xAI 最新模型,1578 分,是榜单上分数最高的非 Anthropic 模型。
国产模型分布。 Kimi K3(1543,第 6 名)和 Qwen3.8 Max(1421,第 9 名)进入前十。DeepSeek V4 Flash 0731 排第 15(1285),GLM-5.2 排第 17(1252)。