此前在OpenRouter上以匿名身份引发关注的模型Ox Alpha,已被智谱正式认领。该模型正是GLM系列的新版本GLM-5.3-Flash。它拥有100万token上下文窗口,支持文本、图片和视频输入,并采用开源与低价策略,上线后迅速冲上OpenRouter使用榜第一。根据平台公开数据,Ox Alpha累计处理了27.2T token,超过排名第二的DeepSeek V4 Flash。
随着身份揭晓,真正的考验也从参数讨论转向实际落地。这次测试围绕三个真实任务展开:视频工作台、实时票务系统和基于玩法视频复刻的驾驶小游戏。结果显示,GLM-5.3-Flash在低成本和多模态入口上优势明显,能够快速生成可操作的应用雏形;但在复杂状态流转和细节打磨上,仍然需要人工介入修复。
低价与多模态是核心卖点
从规格上看,GLM-5.3-Flash是GLM-5系列首个原生多模态模型,总参数320B,激活参数18B,上下文窗口为1M,最大输出约13.1万token。输入端支持文字、图片和视频,输出仍为文本,并支持工具调用。
该模型的设计目标十分明确:降低长上下文与多模态任务的成本。官方资料显示,它在GLM系列中首次将稀疏注意力和线性注意力纳入同一模型,并结合mHC与IndexPool机制,减少无关位置的计算量,同时保留全局信息检索能力。与GLM-5.3相比,GLM-5.3-Flash的注意力计算量降低约3.01倍,KV Cache大小降低约4.44倍。对于需要长时间运行的编码Agent来说,这些指标比总参数更接近真实成本。
价格层面,GLM-5.3-Flash同样具备吸引力。按官方API每百万token美元价格计算,与DeepSeek V4 Pro相比,普通输入和输出价格大约便宜4倍;但在缓存命中场景下,DeepSeek低峰价反而更低。对于需要大量复用前缀的长会话任务,这一差异值得纳入成本评估。此外,OpenRouter页面还显示部分渠道的限时折扣价:输入0.075美元,输出0.25美元,缓存读取0.015美元。
训练方面,智谱称该模型使用了30T token多模态预训练语料。官方在Terminal Bench、DeepSWE、AutomationBench、HLE w/ Tools和GDPval-AA等测试中给出的成绩分别为84.3、63.4、48.8、55.3和1773。Artificial Analysis的Intelligence Index中,智谱博客给出的分数为57分,并将其定位在前沿模型与低成本模型的交叉位置。需要注意的是,榜单成绩来自特定测试条件,并不能直接等同于真实项目的交付成功率。
三个场景实测:有亮点,也有硬伤
本次测试沿用了此前评估其他模型时的三个场景:纯前端视频工作台、带候补流程的实时票务系统,以及根据Drive Mad玩法视频复刻的物理驾驶游戏。重点不是模型能否生成页面,而是能否把功能、状态和交互真正串联起来。
在视频工作台任务中,GLM-5.3-Flash能够上传素材并裁剪片段,最突出的是轨道素材移动时具备吸附功能,这一点在同场测试的其他模型中并未实现。不过,这一亮点并没有完全弥补整体体验的不足。页面样式仍存在明显AI生成痕迹,文字遮挡和布局错乱问题较为突出。裁剪完成后,素材会自动跳到轨道开头,原有位置无法保留;变速和渐变参数修改后也不生效,控件存在但功能未跟上。轨道拖拽本身也不稳定,素材经常会移动到意料之外的位置。
票务系统任务则更直观地暴露了“页面能跑”和“业务能走完”之间的差距。项目可以启动,基础页面也没有明显缺失,但浏览器端主流程在支付环节卡住。完成锁座后发起支付时页面直接报错,后续MockPay、出票、退款、核销和候补流程全部被阻断。此外,多个交互细节也反映出状态设计问题:待支付订单只能继续支付,无法取消;销售看板可以进入但看不到候补队列;候补页面为空;点击整单退款后才提示演出已开始不能退,但按钮仍可点击;演出列表与详情页状态不一致,列表显示售票中,详情页仍可进入选座,下一步却又提示已停售。
相比之下,此前测试的Qwen 3.8 Max和Kimi K3在同一场景下能够走通锁座、支付、出票、退款和候补的主要流程。GLM-5.3-Flash这次则停在支付入口,说明其问题不在页面数量,而在复杂业务状态能否持续推进。
游戏复刻是三个任务中完成度相对较好的一项。测试中直接将玩法视频交给模型,要求其复刻前进、后退、越障和空中姿态控制。最终结果整体可玩,前进与后退控制基本正常,车辆空中旋转和落地反馈也能成立。问题主要集中在操控调校:按键过快会导致车辆在空中持续加速旋转,姿态失控;按键过慢则难以爬坡或越过障碍。虽然不至于无法运行,但速度与物理反馈之间仍需进一步调整。
优势集中在入口与成本,复杂任务仍需人工验收
综合三项测试,GLM-5.3-Flash呈现出较为明显的两极特征。一方面,它具备原生多模态输入、百万级上下文、开源权重和较低API价格,开发者可以很方便地将真实任务交给模型验证。另一方面,参数与榜单并不能替代最终验收。视频工作台的控件未完全生效,票务系统在支付环节中断,游戏操控也需要反复调试。
如果与DeepSeek V4 Pro放在同一语境下观察,差异会更清晰。在票务系统任务中,DeepSeek V4 Pro此前能够走到支付、出票、退款和核销,候补流程也仅在接近完成时出现错误;而GLM-5.3-Flash则在支付入口就停止。在视频工作台任务中,两者都存在速度、转场和拖拽问题,但GLM额外做出了轨道吸附。这说明,GLM-5.3-Flash的优势更集中在多模态入口和成本,而在复杂后端状态推进上仍有差距。
对于开发者而言,GLM-5.3-Flash更像是一款适合快速验证想法的低成本工具。它可以在较短时间内生成具备基本交互能力的应用原型,尤其是在视频输入和多模态任务中提供了更低门槛。但若要将结果交付给真实用户使用,状态一致性、交互细节和失败后的修复,仍然需要人工持续介入。
分类:大模型
原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/zhi-pu-glm5-3flash-shi-ce-di-jia-duo-mo-tai-neng-kuai-su-da