本文采用Artificial Analysis Intelligence Index v4.1。
它由9项评测组成,覆盖智能体任务、编程、科学推理、知识和长文本理解。其中,智能体任务占34%,编程和科学推理各占24%,通用能力占18%。最终排名只按照智能指数排列,价格与速度不会直接改变名次。
表中的max、xhigh、high、medium和low代表不同推理强度。因此,这里的Top 30更准确地说是30种模型配置,而不是30个完全不同的模型。
前三名依旧是Claude Opus 5(max)、Claude Opus 5(xhigh)和Claude Fable 5。GPT-5.6 Sol(max)排名第四,Claude Opus 5(high)排名第五。
前十名中,Anthropic占5个位置,OpenAI占4个位置。Kimi K3(max)以57分排在第七,是前十名中唯一的中国模型。
DeepSeek V4 Flash 0731(max)的智能指数仍为50,排名第二十一。此前榜单只给出了约0.03美元的平均任务成本,没有速度和延迟数据。
今天的页面已经补齐:中位输出速度为116 tokens/s,首段响应约1.34秒,完成一次评测任务的总响应时间约22.92秒。
这组数据让它的位置更容易理解。它的综合能力分数没有进入最前列,但成本较低、首段响应较快,适合继续观察其在批量处理和高频调用场景中的表现。
Kimi K3(max)排名第七,GLM-5.2(max)排名第十六,DeepSeek V4 Flash 0731(max)排名第二十一,Kimi K3(low)排名第二十五,Qwen3.7 Max排名第二十八。
GLM-5.2本次记录的中位输出速度由8月1日的107上升至170 tokens/s,平均任务成本从0.69美元回落到0.57美元。Qwen3.7 Max的速度为205 tokens/s,平均任务成本为1.08美元。
这些变化说明,中国模型并没有走同一条路线:Kimi更接近能力榜前列,DeepSeek强调低成本,GLM和Qwen则在输出速度上更突出。
Muse Spark 1.1(xhigh)的中位速度从8月1日的105升至217 tokens/s;Gemini 3.6 Flash则由220调整为213 tokens/s。与此同时,多种GPT-5.6配置的平均任务成本有所下降。
这些数字来自滚动测量,容易受到服务商、请求路由和近期运行状态影响。它们适合判断当下的API体验,却不宜被解读成模型基础能力在几天内发生了同等幅度的变化。
数据来源:Artificial Analysis LLM Leaderboard
https://artificialanalysis.ai/leaderboards/models
评测方法:Artificial Analysis Intelligence Index v4.1
https://artificialanalysis.ai/methodology/intelligence-benchmarking
数据截点:2026年8月5日