综合智能旗舰全能型选手 · 综合得分 90+ · Tier 1
1DeepSeek V4 深度求索 · MoE 671B/37B · MIT开源
官网:chat.deepseek.com
推理 ▓▓▓▓▓▓▓▓▓▓░ 9.5
编码 ▓▓▓▓▓▓▓▓▓▓ 9.6
语言 ▓▓▓▓▓▓▓▓░░ 8.2
多模态 ▓▓▓▓▓▓░░░░ 6.0
性价比 ▓▓▓▓▓▓▓▓▓▓ 9.8
以极低成本训练出比肩GPT-4o的模型,100万token上下文、MIT完全开源、API价格仅为竞品十分之一。代码与推理登顶国产天花板,AIME数学89.3分。短板在于文采偏理工风,多模态尚弱。
视界锐评
用十分之一的预算干十分之九的活,硅谷最不想看到的对手。
2通义千问 Qwen3 Max 阿里巴巴 · MoE 397B · Apache 2.0开源
官网:tongyi.aliyun.com
推理 ▓▓▓▓▓▓▓▓▓░ 9.2
编码 ▓▓▓▓▓▓▓▓▓░ 8.8
语言 ▓▓▓▓▓▓▓▓▓░ 9.3
多模态 ▓▓▓▓▓▓▓▓▓░ 8.6
性价比 ▓▓▓▓▓▓▓▓▓░ 9.0
全栈能力最均衡的国产模型。千万字级长文本、多模态融合、119种编程语言,从企业API到本地部署全覆盖。Qwen3 Coder专攻编程,SWE-bench 67%登顶开源编程榜。阿里生态深度整合是独特护城河。
视界锐评
六边形战士没有明显短板,开源界的"瑞士军刀"。
3智谱 GLM-5 智谱AI · MoE 744B/40B · MIT开源
官网:chatglm.cn
推理 ▓▓▓▓▓▓▓▓▓▓ 9.6
编码 ▓▓▓▓▓▓▓▓▓░ 8.8
语言 ▓▓▓▓▓▓▓▓▓░ 8.5
多模态 ▓▓▓▓▓▓▓░░░ 7.2
性价比 ▓▓▓▓▓▓▓▓░░ 7.5
推理能力国产第一。AIME数学92.7%、GPQA科学推理86.0%均为国产最高。744B超大参数带来极低幻觉率和极高事实可靠性。Agent原生架构支持复杂多步骤任务。国产算力独立训练标杆,但API成本偏高。
视界锐评
国产推理天花板,用算力堆出来的"最强大脑",也是最能说真话的模型。