实测提升50%的“国模一哥”,不用去上海也能畅游陆家嘴了
创始人
2026-08-21 21:30:36
0

作者|周末

原创首发|蓝字计划

“国产模型一哥”,又杀回战场了。

两个月前,唐杰还在马斯克面前放话:国产模型超越Claude Fable 5,不会太久。现在两个月过去,智谱立马就把对标把Fable 5 的GLM-5.3端了上来。

图源:智谱官方账号

来得虽快,GLM-5.3出手却一点都不含糊。

根据智谱自建的Z.ai Code Bench,GLM-5.3编程能力较GLM-5.2提升了50%,官方也将其称为目前最强的开源权重编程模型

在漏洞挖掘上,GLM-5.3同样不弱。据智谱披露,它一口气找出2436个漏洞,其中1097个属于中高危漏洞,白盒代码审查和漏洞发现能力已经可以对标Mythos 5。

智谱把这轮能力提升的主要功劳,归给了后训练。

一般来说,大模型想变得更强,最直接的办法是扩大参数、增加数据,再做一轮大规模预训练,要付出的代价是更多的GPU、更长训练周期,以及大笔算力、电力和资金支出。

但后训练显然不是这么一回事。简单来说,后训练就是模型完成基础训练后,再通过强化学习不断“特训”,针对具体任务进行优化。

也就是说,别人争着给模型补脑,智谱却靠后天补课,把它练成了神童。

后训练真有这么神?

大模型,也成了做题家

要理解GLM-5.3的能力,还得先回到GLM-5.2。

作为智谱上一代旗舰模型,GLM-5.2已经站到了开源模型第一梯队。

今年6月,智谱开源的GLM-5.2采用了混合专家(MoE)架构,总参数规模约7530亿,上下文窗口达到100万Token。在Artificial Analysis综合能力评测中,GLM-5.2拿下51分,成为当时开源模型中的头部选手。

图源:智谱官网(GLM-5.2跑分数据)

而两个月后的GLM-5.3,没有更换底座,也没有继续扩大参数规模。智谱把主要精力放在了后训练上:长程任务环境规模扩大数十倍,任务场景变得更加丰富,后训练的迭代时间也被明显拉长。

图源:智谱官网

这一变化背后,是唐杰对大模型竞争方向的一次判断:Scaling,不只有参数量这一条路子可以走。

图源:智谱AI创始人,唐杰社交账号

过去,模型升级最直观的方式是扩大参数规模。但随着模型能力逐渐接近瓶颈,单纯“堆参数”带来的收益正在下降。

训练过程本身,同样会决定模型的最终能力,这也成了GLM-5.3的重点。

GLM-5.3开始让模型进入更接近真实工作的任务环境。

在一些高难度任务中,GLM-5.3需要面对完整的工程体系,自己分析性能瓶颈、修改方案、运行测试,并根据反馈不断迭代。而这类任务的复杂程度,已经接近一名经验丰富的工程师连续数天的工作量。

这类训练的核心,是让模型不断强化、学习,并学会如何完成一个目标。

为了扩大这种训练规模,GLM-5.3还尝试自动生成更多长周期任务环境,并通过评估系统验证任务是否有效,让模型能够接触更丰富的工作场景。

有没有效果?直接上跑分数据。

在考验真实终端环境复杂操作的Terminal-Bench 3.0里,GLM-5.3的分数提高了一大截,成绩从GLM-5.2的4.6分提升到28.3分,已经逼近Fable 5的33.7。

而在更考验“长期软件代码能力”的DeepSWE v1.1中,GLM-5.3也从46.2分提升到66.9分,距离Fable 5只差不到3分。

图源:智谱官网 GLM-5.3跑分数据

更有意思的是,不同类型任务之间出现了反差。

越接近真实工作流、越需要模型长期执行的任务,GLM-5.3提升越明显。比如在Terminal-Bench 3.0中,它的成绩增长了接近6倍。

相比之下,在更偏综合能力和多工具协作的Agents' Last Exam中,GLM-5.3提升幅度相对有限,只涨了4.7分。

这样的成绩变化,其实就可以反映了GLM-5.3这轮训练的重点:让模型学会完成一件复杂的事情:理解目标、拆解任务、调用工具、不断验证,直到交付结果。

而这类任务,正是长周期训练环境最能发挥作用的地方。

不过,跑分终归只是跑分。要看这种训练有没有让模型更会干活,还得给它一项足够复杂的任务。

比如,从零复刻一个能真正开车到处逛的陆家嘴。

疯狂补课,确实有用

在基座参数没变的前提下,GLM-5.3编程能力体感暴涨了50%。那我们就看看,GLM-5.3用代码能写出什么好看好玩有意思的画面。

我们交给GLM-5.3和GLM-5.2的任务是:开发一个上海市陆家嘴和外滩区域的3D驾驶小游戏,需求大致涵盖地理复刻、昼夜灯光、车辆物理、导航存档等等

在实测中,GLM-5.3和GLM-5.2交付出的成品明显不同。

GLM-5.2更倾向于快速完成一个完整Demo。在接收到需求后,它直接围绕功能展开,将场景、车辆、灯光、交互等模块逐步实现。最终生成的代码规模较大,覆盖了大量功能需求。

GLM-5.2实测

实际上,GLM-5.2这种面对复杂任务时能快速过一遍设计方案,然后迅速进入执行阶段的能力,对于快速开发非常重要。例如,在要求加入动态灯光系统时,GLM-5.2能够理解昼夜变化需求,并尝试通过时间系统控制灯光状态;在车辆驾驶部分,也加入了相关控制逻辑。

只是这种追求速度的打法,也带来了明显的问题:模型更关注需求清单里的每个功能有没有跑通,轻视了不同模块之间是否协调,以及项目以后要怎么扩展。

于是,在GLM-5.2交付的这个成品里,城市细节可以说是几乎没有的。所有的建筑、地面和车辆,都是同一套色块,灯光也比较线性。

相比之下,GLM-5.3的表现就有明显进步。

在生成结果中,GLM-5.3采用了更接近真实工程项目的分层方式:配置层、核心层、数据层、世界构建层、系统层、装配层,而很少围绕具体功能。

GLM-5.3

这正是长周期后训练想要强化的能力:先规划整体结构,再分步骤实现,并在更长的任务链中处理好前后的依赖关系。

以后想加入更多城市区域、NPC车辆、天气系统或者AI驾驶,只需要在现有架构上继续增加模块,不用把已有代码推倒重来。

而且干活更细致之后,GLM-5.3确实也能带来更好的效果。

当我们在游戏中驾驶着小车车畅游陆家嘴的时候,随车辆移动所产生的影子变化、写字楼的格子间灯光、色彩较多的城市界面、不同的车辆驾驶视角,GLM-5.3都有在还原。

GLM-5.3

甚至是,车辆刹车时的车尾灯开启、车辆惯性、非路面行驶会限速都有体现;物理反馈、摄像机跟随、状态管理,GLM-5.3都有考虑在内。

GLM-5.3

这可不是单纯多放了几个视觉元素。刹车灯需要车辆状态联动灯光系统,非路面限速也需要地形判断与物理系统配合。能把这些细节串起来,说明GLM-5.3对跨模块关系处理的效果不错。

GLM-5.3

可以说,更细的任务拆解和更完整的工程规划,让GLM-5.3交出的成品更完整,也更接近一个可以继续开发的项目。

不过,GLM-5.3也还是有点愚蠢的地方。除了标志性建筑外,其他建筑几乎一个样。并且,许多建筑直接是在路面上生成,所以能看到很多路面是没法通行的。

这些问题也说明,GLM-5.3虽然能够搭起复杂工程,却还没有把整张地图的空间关系检查好。

总的来说,有这样的提升,其实已经能说明后训练这套的确有两把刷子。但这也留下了一个终极问题:既然后训练效果那么好,为什么其他家不来抄抄?

国模一哥,也有保质期

其实,大家早就在干了。

从OpenAI o1到DeepSeek-R1,强化学习早已被用来提升模型的推理和编程能力。智谱这次的不同,是把长周期任务环境扩大数十倍,专门训练GLM-5.3处理复杂工程。

图源:海外用户发文

这办法听起来一点都不神秘,只是门槛也一点不低。

最先,最容易卡住厂商的就是出题。

一道普通的代码题,提前准备好测试用例就能判断对错。长周期编程任务却要把模型放进真实工程,前面改错一个地方,后面整个项目都有可能出问题。

想大规模生成这类任务,还要保证每道题都能正常运行、反复训练,难度远高于收集一批代码。

光有题还不够,评分也得靠谱。

一旦评分标准存在漏洞,模型就可能学会钻空子。表面上分数越来越高,实际任务却没有完成。这就是强化学习中经常出现的“奖励作弊”。

再加上,后训练其实也没有比预训练便宜多少。

一次长周期任务可能要跑上许多轮。模型不断尝试,失败的过程同样消耗Token和算力。后训练顶多是省下了重做模型基座的钱,但要是真到了算账的时候,能省下多少可能真不好说。

图源:海外用户发文

更别说它还有一个更明显的边界:练什么,就只学什么。

GLM-5.3在Terminal-Bench 3.0中的成绩从4.6分涨到28.3分,接近翻了六倍;在考察综合能力和多工具协作的Agents' Last Exam中,却只提高了4.7分,就是最好的案例。

因此,所谓50%的编程能力提升,主要集中在长周期编程和复杂工程任务上,绝对不能和整个模型的能力提升了 50% 划等号。

正因如此,后训练更适合把底座已经具备的能力继续补强,要是底座里本来就没有的知识和能力,就没法通过后训练长出来了。

那为什么后训练依然如此受欢迎呢?因为确实高效率啊。

过去,厂商往往要等到下一代基座训练完成,才能迎来一次大升级。现在,同一套基座换一批任务环境、重新训练几个月,也可能推出一个能力明显更强的新版本。

一个模型刚在榜单上冲到前面,对手很快就能用新的训练方法追上来。今天领先的能力,过几个月可能就成了其他模型的基础配置。

智谱在Blog最前面写下“单弦不成音,独木不成林”。这句话听起来很从容,也正好说中了现在的局面:模型厂商各有路线,第一梯队的位置也会反复换人

只是智谱能一直从容吗?这或许是整个大模型行业,都需要自我拷问的问题。

参考资料:

[1]数字生命卡兹克:聊聊唐杰老师对GLM-5.3和Scaling Law的思考

[2]量子位:刚刚,GLM-5.3发布:Coding更接近Fable 5!潜伏40年的bug都被揪出来了

[3]APPSO:实测GLM-5.3: 在神仙打架的一周杀回国模顶流,还按下了重置键

[4]钛媒体:GLM-5.3发布,基座没变,能力却涨了

[5]AI科技评论:GLM-5.3来了:底座没换,编程暴涨 50%,还顺手揪出潜伏40年的世界级漏洞

相关内容

热门资讯

国内商品期货夜盘开盘多数上涨,... 8月21日,国内商品期货夜盘开盘多数上涨,沪银涨1.72%,焦炭涨1.36%,乙二醇涨1.32%,沪...
上海印发《上海市综合交通发展“... 8月21日,上海市人民政府办公厅近日发布关于印发《上海市综合交通发展“十五五”规划》的通知。规划指出...
把国产大模型生意做到海外,临港... 来源:界面新闻 界面新闻记者 | 崔逸星 界面新闻编辑 | 庄键 过去一段时间,Paean团...
入耳式蓝牙耳机哪款值得买?20... 每天挤地铁上下班、办公室键盘敲不停、宿舍室友开黑外放……这些时候,一副靠谱的入耳降噪耳机基本是刚需。...
刘国中在安排部署秋粮生产和农业... 8月21日,中共中央政治局委员、国务院副总理刘国中8月21日到农业农村部召开视频调度会,安排部署秋粮...
“十五五”期间我国将全力构建现... 新华社北京8月21日电 记者21日从中国气象局了解到,中国气象局日前出台的《气候业务高质量发展实施方...
Genki推出Manta游戏手... IT之家 8 月 21 日消息,外设厂商 Genki 现已推出首款号称是“完全由自家团队从零设计的游...
BOE(京东方)携手3M共建联... 8月21日,以“乘屏而上”为主题的BOE(京东方)-3M联合实验室发布会在京东方技术创新中心举办,双...
宝马新世代正式入华,iX3全国... 8月21日,成都车展期间,新世代BMW iX3正式开启预订,全国统一价26.99万元起,并采取预订与...