作者|周末
原创首发|蓝字计划
“国产模型一哥”,又杀回战场了。
两个月前,唐杰还在马斯克面前放话:国产模型超越Claude Fable 5,不会太久。现在两个月过去,智谱立马就把对标把Fable 5 的GLM-5.3端了上来。
图源:智谱官方账号
来得虽快,GLM-5.3出手却一点都不含糊。
根据智谱自建的Z.ai Code Bench,GLM-5.3编程能力较GLM-5.2提升了50%,官方也将其称为目前最强的开源权重编程模型。
在漏洞挖掘上,GLM-5.3同样不弱。据智谱披露,它一口气找出2436个漏洞,其中1097个属于中高危漏洞,白盒代码审查和漏洞发现能力已经可以对标Mythos 5。
智谱把这轮能力提升的主要功劳,归给了后训练。
一般来说,大模型想变得更强,最直接的办法是扩大参数、增加数据,再做一轮大规模预训练,要付出的代价是更多的GPU、更长训练周期,以及大笔算力、电力和资金支出。
但后训练显然不是这么一回事。简单来说,后训练就是模型完成基础训练后,再通过强化学习不断“特训”,针对具体任务进行优化。
也就是说,别人争着给模型补脑,智谱却靠后天补课,把它练成了神童。
后训练真有这么神?
要理解GLM-5.3的能力,还得先回到GLM-5.2。
作为智谱上一代旗舰模型,GLM-5.2已经站到了开源模型第一梯队。
今年6月,智谱开源的GLM-5.2采用了混合专家(MoE)架构,总参数规模约7530亿,上下文窗口达到100万Token。在Artificial Analysis综合能力评测中,GLM-5.2拿下51分,成为当时开源模型中的头部选手。
图源:智谱官网(GLM-5.2跑分数据)
而两个月后的GLM-5.3,没有更换底座,也没有继续扩大参数规模。智谱把主要精力放在了后训练上:长程任务环境规模扩大数十倍,任务场景变得更加丰富,后训练的迭代时间也被明显拉长。
图源:智谱官网
这一变化背后,是唐杰对大模型竞争方向的一次判断:Scaling,不只有参数量这一条路子可以走。
图源:智谱AI创始人,唐杰社交账号
过去,模型升级最直观的方式是扩大参数规模。但随着模型能力逐渐接近瓶颈,单纯“堆参数”带来的收益正在下降。
训练过程本身,同样会决定模型的最终能力,这也成了GLM-5.3的重点。
GLM-5.3开始让模型进入更接近真实工作的任务环境。
在一些高难度任务中,GLM-5.3需要面对完整的工程体系,自己分析性能瓶颈、修改方案、运行测试,并根据反馈不断迭代。而这类任务的复杂程度,已经接近一名经验丰富的工程师连续数天的工作量。
这类训练的核心,是让模型不断强化、学习,并学会如何完成一个目标。
为了扩大这种训练规模,GLM-5.3还尝试自动生成更多长周期任务环境,并通过评估系统验证任务是否有效,让模型能够接触更丰富的工作场景。
有没有效果?直接上跑分数据。
在考验真实终端环境复杂操作的Terminal-Bench 3.0里,GLM-5.3的分数提高了一大截,成绩从GLM-5.2的4.6分提升到28.3分,已经逼近Fable 5的33.7。
而在更考验“长期软件代码能力”的DeepSWE v1.1中,GLM-5.3也从46.2分提升到66.9分,距离Fable 5只差不到3分。
图源:智谱官网 GLM-5.3跑分数据
更有意思的是,不同类型任务之间出现了反差。
越接近真实工作流、越需要模型长期执行的任务,GLM-5.3提升越明显。比如在Terminal-Bench 3.0中,它的成绩增长了接近6倍。
相比之下,在更偏综合能力和多工具协作的Agents' Last Exam中,GLM-5.3提升幅度相对有限,只涨了4.7分。
这样的成绩变化,其实就可以反映了GLM-5.3这轮训练的重点:让模型学会完成一件复杂的事情:理解目标、拆解任务、调用工具、不断验证,直到交付结果。
而这类任务,正是长周期训练环境最能发挥作用的地方。
不过,跑分终归只是跑分。要看这种训练有没有让模型更会干活,还得给它一项足够复杂的任务。
比如,从零复刻一个能真正开车到处逛的陆家嘴。
在基座参数没变的前提下,GLM-5.3编程能力体感暴涨了50%。那我们就看看,GLM-5.3用代码能写出什么好看好玩有意思的画面。
我们交给GLM-5.3和GLM-5.2的任务是:开发一个上海市陆家嘴和外滩区域的3D驾驶小游戏,需求大致涵盖地理复刻、昼夜灯光、车辆物理、导航存档等等。
在实测中,GLM-5.3和GLM-5.2交付出的成品明显不同。
GLM-5.2更倾向于快速完成一个完整Demo。在接收到需求后,它直接围绕功能展开,将场景、车辆、灯光、交互等模块逐步实现。最终生成的代码规模较大,覆盖了大量功能需求。
GLM-5.2实测
实际上,GLM-5.2这种面对复杂任务时能快速过一遍设计方案,然后迅速进入执行阶段的能力,对于快速开发非常重要。例如,在要求加入动态灯光系统时,GLM-5.2能够理解昼夜变化需求,并尝试通过时间系统控制灯光状态;在车辆驾驶部分,也加入了相关控制逻辑。
只是这种追求速度的打法,也带来了明显的问题:模型更关注需求清单里的每个功能有没有跑通,轻视了不同模块之间是否协调,以及项目以后要怎么扩展。
于是,在GLM-5.2交付的这个成品里,城市细节可以说是几乎没有的。所有的建筑、地面和车辆,都是同一套色块,灯光也比较线性。
相比之下,GLM-5.3的表现就有明显进步。
在生成结果中,GLM-5.3采用了更接近真实工程项目的分层方式:配置层、核心层、数据层、世界构建层、系统层、装配层,而很少围绕具体功能。
GLM-5.3
这正是长周期后训练想要强化的能力:先规划整体结构,再分步骤实现,并在更长的任务链中处理好前后的依赖关系。
以后想加入更多城市区域、NPC车辆、天气系统或者AI驾驶,只需要在现有架构上继续增加模块,不用把已有代码推倒重来。
而且干活更细致之后,GLM-5.3确实也能带来更好的效果。
当我们在游戏中驾驶着小车车畅游陆家嘴的时候,随车辆移动所产生的影子变化、写字楼的格子间灯光、色彩较多的城市界面、不同的车辆驾驶视角,GLM-5.3都有在还原。
GLM-5.3
甚至是,车辆刹车时的车尾灯开启、车辆惯性、非路面行驶会限速都有体现;物理反馈、摄像机跟随、状态管理,GLM-5.3都有考虑在内。
GLM-5.3
这可不是单纯多放了几个视觉元素。刹车灯需要车辆状态联动灯光系统,非路面限速也需要地形判断与物理系统配合。能把这些细节串起来,说明GLM-5.3对跨模块关系处理的效果不错。
GLM-5.3
可以说,更细的任务拆解和更完整的工程规划,让GLM-5.3交出的成品更完整,也更接近一个可以继续开发的项目。
不过,GLM-5.3也还是有点愚蠢的地方。除了标志性建筑外,其他建筑几乎一个样。并且,许多建筑直接是在路面上生成,所以能看到很多路面是没法通行的。
这些问题也说明,GLM-5.3虽然能够搭起复杂工程,却还没有把整张地图的空间关系检查好。
总的来说,有这样的提升,其实已经能说明后训练这套的确有两把刷子。但这也留下了一个终极问题:既然后训练效果那么好,为什么其他家不来抄抄?
其实,大家早就在干了。
从OpenAI o1到DeepSeek-R1,强化学习早已被用来提升模型的推理和编程能力。智谱这次的不同,是把长周期任务环境扩大数十倍,专门训练GLM-5.3处理复杂工程。
图源:海外用户发文
这办法听起来一点都不神秘,只是门槛也一点不低。
最先,最容易卡住厂商的就是出题。
一道普通的代码题,提前准备好测试用例就能判断对错。长周期编程任务却要把模型放进真实工程,前面改错一个地方,后面整个项目都有可能出问题。
想大规模生成这类任务,还要保证每道题都能正常运行、反复训练,难度远高于收集一批代码。
光有题还不够,评分也得靠谱。
一旦评分标准存在漏洞,模型就可能学会钻空子。表面上分数越来越高,实际任务却没有完成。这就是强化学习中经常出现的“奖励作弊”。
再加上,后训练其实也没有比预训练便宜多少。
一次长周期任务可能要跑上许多轮。模型不断尝试,失败的过程同样消耗Token和算力。后训练顶多是省下了重做模型基座的钱,但要是真到了算账的时候,能省下多少可能真不好说。
图源:海外用户发文
更别说它还有一个更明显的边界:练什么,就只学什么。
GLM-5.3在Terminal-Bench 3.0中的成绩从4.6分涨到28.3分,接近翻了六倍;在考察综合能力和多工具协作的Agents' Last Exam中,却只提高了4.7分,就是最好的案例。
因此,所谓50%的编程能力提升,主要集中在长周期编程和复杂工程任务上,绝对不能和整个模型的能力提升了 50% 划等号。
正因如此,后训练更适合把底座已经具备的能力继续补强,要是底座里本来就没有的知识和能力,就没法通过后训练长出来了。
那为什么后训练依然如此受欢迎呢?因为确实高效率啊。
过去,厂商往往要等到下一代基座训练完成,才能迎来一次大升级。现在,同一套基座换一批任务环境、重新训练几个月,也可能推出一个能力明显更强的新版本。
一个模型刚在榜单上冲到前面,对手很快就能用新的训练方法追上来。今天领先的能力,过几个月可能就成了其他模型的基础配置。
智谱在Blog最前面写下“单弦不成音,独木不成林”。这句话听起来很从容,也正好说中了现在的局面:模型厂商各有路线,第一梯队的位置也会反复换人。
只是智谱能一直从容吗?这或许是整个大模型行业,都需要自我拷问的问题。
参考资料:
[1]数字生命卡兹克:聊聊唐杰老师对GLM-5.3和Scaling Law的思考
[2]量子位:刚刚,GLM-5.3发布:Coding更接近Fable 5!潜伏40年的bug都被揪出来了
[3]APPSO:实测GLM-5.3: 在神仙打架的一周杀回国模顶流,还按下了重置键
[4]钛媒体:GLM-5.3发布,基座没变,能力却涨了
[5]AI科技评论:GLM-5.3来了:底座没换,编程暴涨 50%,还顺手揪出潜伏40年的世界级漏洞