GLM5.3跻身AA排行榜60分俱乐部了
Artificial Analysis发布了最新的大模型智能排行榜,GLM-5.3迈入60分俱乐部,和Kimi K3并列第四。
排在前面的分别是A\家的Opus 5、Fable 5,以及OpenAI家的GPT-5.6 Sol。
这基本上就是目前AI大模型领域最强大的几个模型了。
有意思的是,GLM-5.3的参数规模是里面最小的。
在参数量已经公开的头部模型中,Kimi K3拥有2.8万亿参数,Qwen3.8-Max是2.4万亿,DeepSeek V4 Pro是1.6万亿,而GLM-5.3只有7530亿参数。
虽然OpenAI和Anthropic没有公布模型规模,但行业普遍认为,它们的旗舰模型同样是参数量巨大的“巨无霸”。
GLM-5.3没有重新训练一个更大的基础模型,它使用的还是GLM-5.2的底座,参数规模基本没变,官方称这次能力提升全部来自后训练。
那么,什么是后训练,为什么它居然有这么大的威力?
大模型首先要经过预训练,阅读海量文本和代码,学习语言规律、知识以及解决问题所需要的基础能力。预训练结束后,模型更像一个读了很多书,却还不太会工作的学生。
后训练就是在这个基础上,继续教它如何回答问题、遵循指令、使用工具和完成任务。其中既包括用高质量示范进行监督微调,也包括通过强化学习,让模型不断尝试,再根据结果给予奖励。
GLM-5.3这次重点强化的是后者。智谱为它准备了更多接近真实工作的任务环境:模型需要阅读代码、调用工具、运行程序、观察结果、发现错误,再调整方案继续执行。任务能否完成,可以由程序直接验证,因此模型能够获得相对明确的奖励信号。
这类训练的目标不再是增加模型的知识量,转而聚焦让它“把已有能力发挥出多少”。
当然,这不意味着参数规模已经不重要。更大的预训练模型通常拥有更高的能力上限,GLM-5.3在测试中也使用了较长的思考过程。
但GLM-5.3说明了:模型变强不是只有继续堆参数这一条路。