目前可核对到的最新公开数据是:
| 榜单 | 数据时间 | 最新头部格局 |
|---|
| 综合文本榜 | 截至 2026-09-13 | claude-fable-5-high 1506 分第一;Claude Opus 4.6 high、Opus 4.7 high、Claude Fable 5.1 max、Meta Muse Spark、Gemini 3.8-flash-high 等紧追其后 |
| 代码/WebDev榜 | 截至 2026-09-23/24 | Claude Opus 5.5 max 以 1818 分登顶,领先 GPT-6 Astra max 的 1792 分 |
| 综合周榜 | 截至 2026-09-06 | Claude Fable 5 约 1507 分仍居首,Anthropic、Meta、Google、OpenAI 头部模型分数非常接近 |
几个值得注意的点:
综合榜和代码榜不能混着比。综合榜看通用对话体验,代码榜更偏编程、前端、智能体开发任务。
前几名分差很小,很多都在误差范围内,排名会随投票量波动。
Claude Opus 5.5 是最近最大的变量。它在 9 月 22 日发布后,很快在 Code Arena WebDev 上冲到第一,但综合文本榜的最新完整更新尚未同步到同一日期。
国产模型里,Kimi K3 Max、Qwen3.8-Max、GLM-5.3 系列在代码、前端、智能体等分榜上表现比较突出。