8月26日,智谱正式上线并开源GLM-5.3-Flash(320B-A18B)。这是GLM-5系列中的首个原生多模态模型,也是一款以低激活参数、混合注意力架构和大幅降价为主要卖点的开源前沿模型。按照官方口径,其正式定价为GLM-5.3的1/10,限时折扣期间进一步降至GLM-5.3的1/20,约为Anthropic Claude Opus 4.8价格的1/40。
匿名模型Ox Alpha先行,测试流量由国产芯片支撑
在正式发布前,智谱并未直接亮出GLM-5.3-Flash的名字,而是以匿名模型Ox Alpha的形式,将其放到OpenCode和OpenRouter平台上进行大规模测试。该匿名模型在中文社区也被称作“牛来”。
测试期间,Ox Alpha迅速成为当周最受欢迎的模型,并创下两个平台调用量的新高。值得关注的是,智谱表示这些请求流量全部由国产芯片提供算力支持。对于一款尚未正式发布的模型而言,这种匿名上线的方式既是一次公开环境下的压力测试,也让模型在没有品牌预期的情况下直接接受开发者调用反馈。
320B总参数、18B激活,主打MoE推理效率
从参数规模看,GLM-5.3-Flash的总参数量为320B,即3200亿,但激活参数仅为18B,即180亿。这意味着模型在推理时实际调动的计算规模明显低于同级别稠密模型,也更适合围绕推理效率和服务成本进行优化。
智谱称,GLM-5.3-Flash采用全新模型架构,专为极低成本设计。其总参数量与GLM-4.5相当,后者为355B,GLM-5.3-Flash为320B;但GLM-5.3-Flash的激活参数从32B降至18B,层数也从92层减少到45层,几乎减半。再结合最新的30T Token多模态预训练语料,官方称其能够以更少的计算资源实现更强性能。
在架构层面,GLM-5.3-Flash还引入了多项升级:
- 首个采用稀疏注意力与线性注意力混合架构的开源前沿模型,用于在保持长上下文能力的同时降低长上下文服务成本;
- 采用流形约束超连接(Manifold-Constrained Hyper-Connections,mHC),以提升模型Scaling能力;
- 作为原生多模态模型,将视觉能力融入模型训练和任务执行流程。
能力对标Claude Opus 4.8,价格大幅下探
性能方面,智谱表示,GLM-5.3-Flash在各项基准测试和实际使用中全面超越参数量高出一倍的GLM-5.2。在Artificial Analysis Intelligence Index(AA综合智能指数)中,GLM-5.3-Flash取得57分,进入全球前沿模型能力区间,并与Anthropic最受欢迎的模型Claude Opus 4.8得分持平。
在智谱自研的Z.ai Code Bench体感评估中,GLM-5.3-Flash的编程表现也与Claude Opus 4.8相当。对于开发者而言,这类评估更贴近实际代码任务中的使用体验,而不仅是静态榜单分数。
价格则是这款模型的另一条主线。官方给出的对比是:GLM-5.3-Flash定价为GLM-5.3的1/10,限时折扣内为GLM-5.3的1/20,为Opus 4.8的1/40。若这一价格体系落地,模型调用成本将明显低于同档位前沿模型,尤其适合高频编码、长上下文处理和大规模Agent调用场景。
视觉进入编码循环,覆盖办公与文档工作流
作为GLM-5系列首个原生多模态模型,GLM-5.3-Flash的视觉能力并非外挂式识别,而是被融入Coding循环。官方称,模型能够主动观察界面、渲染结果与交互反馈,并据此持续测试和改进。
在具体应用中,这一能力可覆盖前端开发、游戏构建、Blender 3D场景,以及BUA、CUA驱动的真实环境操作。模型可以在代码、浏览器和图形界面之间协同完成任务,而不是仅依赖文本输入输出。
除编码场景外,GLM-5.3-Flash还延伸至Office、金融研究和专业文档等工作场景。官方表示,模型能够自主拆解复杂目标、调用合适工具、检查并优化输出,完成从研究分析、模型构建到PPTX、PDF、DOCX、XLSX成品交付的完整工作流。
目前,GLM-5.3-Flash已正式面向全球开源,并接入ZCode等编码平台,同步开放API调用。该模型也被纳入GLM Coding Plan,每天限量发放10,000张体验卡。对于国内开源模型生态而言,这款模型的意义不只是参数和评分,更在于智谱试图用更低的激活参数、更低的调用价格和原生多模态能力,推动前沿模型走向高频、可规模化的实际生产环境。
原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/zhi-pu-kai-yuan-320b-yuan-sheng-duo-mo-tai-mo-xing-glm5