智谱:GLM-5.3-Flash跑在国产芯片上 人民财讯8月27日电,8月26日晚间,智谱官微发布,为收集广大用户的广泛、专业反馈,GLM-5.3-Flash在正式发布前,以匿名模型Ox-Alpha(中文社区称作“牛来”)在OpenCode和OpenRouter上进行了大规模测试。Ox-Alpha迅速成为当周最受欢迎的模型,创下双平台调用量新高。而这些请求流量全部由国产芯片提供算力支持。 “过去一周,我们首次在大规模流量中尝试用大国产芯片集群提供服务,这些芯片通过自研高带宽互联网络连接。”智谱表示。 在集群层面,该公司采用生产级Encode–Prefill–Decode(EPD)分离式架构,将多模态编码、prompt预填充和逐token解码拆分为可独立调度、独立扩缩容的工作池,从而在国产加速芯片上实现了高效、可靠的服务。 “与同一硬件上的初始基线相比,端到端服务性能提升了3倍,硬件效率和单token成本已达到与主流英伟达GPU相当的水平。这证明国产芯片完全可以在大规模场景下高效、经济地支撑前沿模型的推理需求。”智谱称。