🍃现在已经很难用一个“第一名”概括大模型竞争。综合真人偏好、推理、Coding、多模态等榜单,目前值得重点关注的包括以下几个系列:Claude 系列、GPT-5.6、Qwen3.8 Max、Kimi K3、Gemini 等。
🍃推荐如下:
科研 / 高难度推理:Claude、GPT
编程 Agent:Claude、GPT
中文写作:Qwen、Claude
多模态办公:Qwen、Gemini
大规模 API 调用:DeepSeek、Qwen
追求极致能力:优先看 Claude、GPT、Kimi
🍃这类榜单,有较高的时效性,有一些大模型不排除有刷榜单的嫌疑。所以相比“模型考了多少分”,我会更关注。“谁能用更低成本、更高成功率,把真实任务完成”。
#agent #llm #LLM #数据呼吸 #数据呼吸Lex #大模型 #智能体