@Catho168智谱发布GLM-5.3-Flash:在中国AI芯片上规模化部署服务 中发帖

博客原文:GLM-5.3-Flash: Frontier Intelligence, Flash Cost 

我们推出了GLM-5.3-Flash,这是GLM-5系列中首款原生多模态模型。该模型总参数量达3200亿,而激活参数量仅为180亿,在各项基准测试和实际工作负载中均优于GLM-5.2,且成本仅为后者的十分之一,同时在编程和智能体基准测试上接近Claude Opus 4.8的水平。
GLM-5.3-Flash在GLM-5的基础上引入了多项架构改进。我们首次推出结合稀疏注意力和线性注意力的混合架构,大幅降低长上下文服务成本,同时保持精准的长上下文能力。该模型还采用了流形约束超连接(mHC)以进一步提升扩展效率。结合我们最新的30T token多模态预训练语料库,这些改进使得GLM-5.3-Flash能够以更少的计算资源产生更强的智能。
在发布之前,我们以ox-alpha的身份在O...