上一篇把14个模型家族认全了,但"认识"和"选对"是两回事。很多人挑模型的方式就两种:谁火选谁,或者谁参数大选谁。这两种做法,大概率会选到"不是最合适"的那一个。
这篇换一条思路:先定你的任务,再反查该用哪家。整理了两样东西:12个常见场景的推荐表,和5个能自己验证的中立评测网站。看完你就可以自己判断,不用再等别人安利。
一、12个场景,对号入座
读表之前先说清楚:这里的推荐不是"唯一答案",而是"大概率合适的起点"。选之前先给自己定三个约束——预算、隐私、部署方式(云端API还是本地跑),约束定了,候选范围就小一大半。
| | |
|---|
| | Cookbook + Courses 是社群公认最完整的 |
| | |
| | |
| 广度查询 + function calling 框架 | | |
| | Kimi 长上下文能塞整本书;DeepSeek 成本最低;GLM 对 agent 友好 |
| | |
| DeepSeek V4-Pro / Hunyuan T1 / OpenAI o系列 | |
| Llama 3.3 / Gemma 4 / Qwen 开源版 | |
| Gemma 4 / Phi-4 / qwen3-3B 及以下 | |
| Gemini(2M 窗口)/ Kimi K3(1M) | |
| | |
| | |
最后一行是我自己加进去的,不算推荐,是个经验:API 的调用方式大同小异,先拿任何一家把流程跑通,比纠结选谁重要得多。
二、5个中立评测网站,自己验证
推荐表是"别人替你总结的结论",如果你想自己看数据,下面5个中立资源值得收藏。它们不是同一家出的,用途也不一样(状态为2026年5月):
| | |
|---|
| 第三方 benchmark + 价格/延迟整合,含中国模型 | |
| Arena AI(原 LMSYS Chatbot Arena) | | |
| | |
| | 偶尔 runtime error,可改用 Arena 的开源 tab |
| | |
原则就一条:不靠单一 source 下结论。两三个网站交叉看,比盯着一家排行榜强。
说个实际用法:拿 Artificial Analysis 举例,查的顺序一般是先筛价格、再看性能、最后自己跑——第一步用价格把候选砍到两三家(预算约束),第二步看性能分定最终候选,第三步回到第一节的"小实验"环节,用你自己的 prompt 做最后裁决。这样整个选型过程,别人的榜单只负责缩小范围,决定权始终在你手里。
三、4条警语,比任何推荐都重要
1. 榜单 ≠ 真实表现。模型在你的具体任务上好不好,要自己跑小实验:贴10个你真实的 prompt,看哪家答得最像你要的。只看通用指标就下单,大概率买错。
2. 半年洗一次牌。上面所有数字都是2026年5月的快照,之后请以官方文档和 Artificial Analysis 为准。
3. "强项"是相对的。所有旗舰模型完成基本任务都没问题,差别只出现在困难情境:超长文件、复杂推理、多语言。
4. 中文任务看 SuperCLUE。国际 benchmark(如 MMLU)以英文为主,中文表现可能跟英文不一致——英文榜单高,不代表中文好用。
一句话总结
选模型的正确姿势不是追热门,是先定任务再反查,最后用10个真实 prompt 做小实验验证。
—— 完 ——
如果这篇文章对你有帮助,点个关注。下一篇开始动手:用 Python 亲手调一次大模型 API,看看 temperature 从 0 调到 1,输出到底怎么变。
有任何问题或者想看的主题,欢迎留言。