智谱GLM-5.3来了:基座没变,编程能力提升50%,国产AI开始卷“后训练”
过去两年,大模型行业最容易吸引市场注意力的数字是什么?
参数量、GPU数量、训练成本。
但智谱刚刚发布的GLM-5.3,给出了一个很有意思的新答案:基座模型可以不变,模型能力仍然可以继续大幅提升。
8月14日,智谱正式发布GLM-5.3。与GLM-5.2相比,新模型并没有重新训练一个更大的基座,而是在原有基座之上扩大后训练规模,包括更长程的任务环境、更丰富的环境类型以及更长时间的后训练。智谱内部Z.ai Code Bench显示,其编程能力较GLM-5.2提升约50%。
这件事值得资本市场关注的地方,并不只是“国产模型又升级了一次”。
而是大模型竞争的逻辑正在发生变化。
第一阶段,比的是预训练。
谁拥有更多GPU、更大的参数量、更大的训练数据集,谁更有机会提高模型能力上限。
于是过去几年AI产业链最大的确定性之一,就是算力需求不断扩张。
但当基础模型能力逐渐逼近之后,继续单纯增加参数的边际收益正在下降。
于是第二场竞争开始了:
后训练。
所谓Post-training Scaling,可以简单理解为:底层“大脑”没有重新造,但通过强化学习、任务环境、工具调用训练以及更复杂的Agent任务,让模型学会更加高效地解决问题。
GLM-5.3就是一个非常典型的案例。
Terminal-Bench 3.0上,GLM-5.3从上一代的4.6提升至28.3;DeepSWE也从46.2提升至66.9。与此同时,智谱把Coding Agent和长程任务作为此次升级的重要方向。
这意味着AI行业正在从:
“模型会不会回答问题”
进入:
“模型能不能完成工作”。
这是两个完全不同的商业逻辑。
聊天机器人主要消耗的是Token。
而Agent真正进入企业之后,需要连接代码库、数据库、浏览器、Terminal、ERP、CRM以及各种企业内部系统,然后持续执行复杂任务。
AI的价值衡量标准也会从“模型参数有多大”,逐渐变成:
完成一个真实任务,需要多少钱、多少Token、多少时间,以及成功率是多少。
这也是我认为GLM-5.3真正值得关注的地方。
甚至网络安全已经成为新的能力边界。智谱公布的CyberGym漏洞发现测试中,GLM-5.3取得84.5%的成绩;不过在更强调漏洞利用能力的ExploitBench中仍落后于Anthropic Mythos 5,因此更准确的理解应该是:部分安全任务已经进入全球第一梯队,而不是简单的“全面超越”。
从投资视角继续往下推演,AI产业链可能正在形成新的价值迁移:
第一阶段:GPU和算力。
第二阶段:基础模型。
第三阶段:Agent、Coding、企业AI应用。
算力当然不会消失,但未来决定AI商业化速度的,可能越来越不是“能训练多大的模型”,而是:
谁能够让模型真正干活。
GLM-5.3最值得关注的,不是“50%”这个数字本身。
而是一个信号:
国产大模型已经开始从参数竞争,进入工程能力和生产力竞争。
而这场竞争,可能才刚刚开始。
本文仅为人工智能产业与技术趋势观察,不构成任何投资建议。
免责声明:上述内容仅代表发帖人个人观点,不构成本平台的任何投资建议。


