8月26日智谱正式上线并开源GLM-5.3-Flash320B-A18B——这是 GLM-5 系列的首个原生多模态模型。320B 总参数能力超越 GLM-5.2在全球权威的Artificial Analysis Intelligence IndexAA 综合智能指数中取得 57 分进入全球前沿模型能力区间与Anthropic最受欢迎的Claude Opus 4.8 得分持平。更值得关注的是过去一周的大规模流量 由国产芯片集群提供服务。GLM-5.3-Flash 已上线魔乐社区开发者可直接下载开源权重。 链接https://modelers.cn/models/zhipuai/GLM-5.3-Flash01 模型亮点极致性价比一半参数更强能力十分之一价格GLM-5.3-Flash 的架构专为极低成本设计。总参数量与 GLM-4.5 相当320B vs 355B但激活参数量从 32B 降到 18B层数从 92 层减半到 45 层——却在各项基准测试和实际使用中全面超越参数量高出一倍的 GLM-5.2定价仅为后者的 1/10。这得益于两项关键架构创新稀疏注意力 线性注意力混合架构首个采用该架构的开源前沿模型线性注意力通过递归机制捕获局部依赖关系稀疏注意力则借助轻量级索引器召回全局上下文在保持精准长上下文能力的同时大幅降低服务成本。流形约束超连接mHC进一步提升模型 Scaling 效率让更少的计算资源产出更强的性能。结合智谱最新的 30T Token 多模态预训练语料GLM-5.3-Flash 能用更少的计算资源实现更强的性能。支持 1M Token 超长上下文同时支持图像和视频输入。官方博客https://z.ai/blog/glm-5.3-flash原生多模态代码循环中的视觉反馈GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型。视觉编码不只是“处理图片”它拓展了编程能触及的边界。对于前端开发、游戏开发、3D 仿真等任务最终产物是用户能感知的界面、交互或虚拟世界。视觉能力被原生集成进模型后它能自主判断何时需要“观察”并利用视觉反馈指导下一步行动——很多问题只有在渲染、交互或试玩时才会暴露。智谱为此开发了数据合成流水线聚焦模型的自我视觉判断与测试时改进。在前端 Coding 方面还探索了基于环境反馈的强化学习通过真实用户流程的 Agent 验证强化 GUI 判断能力把验证范畴从功能正确性延伸到渲染效果与交互体验。「Code 让模型构建和改变世界Vision 让它进入人们看见和使用的世界。」一个令人意外的发现Coding 成了模型表达并检验世界知识的代理。在没有任何外部素材的情况下GLM-5.3-Flash 自主运行 16 个小时在 Blender 中搭建了一套约 400 平方米的专业主厨自宅与测试厨房——几何、材质、光照、空间在不同视角下都保持一致。在 ZCode 中Browser Use AgentBUA与 Computer Use AgentCUA进一步拓展多模态能力让模型在代码、浏览器与图形界面之间协同工作同时观察并验证自身输出。以下是在ZCode中使用GLM-5.3-Flash实测合集从图像到可运行工程从两小时电影到8分钟成片以及可直接交付的白领专业文档。超越 Coding专业工作的全能伙伴视觉理解能力让 GLM-5.3-Flash 在专业工作中表现显著提升。针对 PPTX、PDF、DOCX、XLSX 等 Office 文档任务模型能检查并优化自身输出具备更强的审美判断——可以将输出结果与视觉上下文、预期结果对比实现更有效的自我验证与优化。金融领域覆盖从基于来源的金融研究、报告生成到金融建模与分析的完整流程全程提供可追溯的参考依据。法律领域能审查合同中的费用、账户与责任条款按律师惯例批注留痕也能起草律师函、合同与诉讼文书格式版式符合实务规范生成即可交付。02 跑在国产芯片上过去一周GLM-5.3-Flash 首次在大规模流量中用国产芯片集群提供服务芯片通过自研高带宽互联网络连接。挑战与突破单张国产芯片的算力与内存容量相对有限尤其是支持 1M 上下文长度对内存容量和带宽要求极高。智谱团队做了以下优化专用推理引擎在 SGLang 基础上构建专用推理引擎。值得一提的是整个构建工作由 GLM-5.3 驱动的 infra agent大大加速——它协助工程师开发优化算子、诊断性能瓶颈、改进部署服务栈形成“模型优化系统系统承载模型”的正向循环。激进的内存优化针对底层架构进行以算力换带宽、以通信换显存等定制优化。技术栈结合了线性注意力和 LM head 的节点内张量并行、ReplaySSM、W8A8 量化、INT8/FP8/BF16 混合缓存量化以及 Layer Split 等技术。EPD 分离架构集群层面采用生产级 Encode–Prefill–DecodeEPD分离式架构将多模态编码、prompt 预填充和逐 token 解码拆分为可独立调度、独立扩缩容的工作池在数万颗国产加速芯片上实现高效可靠的服务。结果3×: 端到端性能提升持平: 硬件效率与单 token 成本对标英伟达 GPU 国产芯片完全可以在大规模场景下高效、经济地支撑前沿模型的推理需求。03 下载体验GLM-5.3-Flash 已正式面向全球开源欢迎广大开发者在魔乐社区下载权重https://modelers.cn/models/zhipuai/GLM-5.3-Flash