Z.ai 发布 GLM-5.3-Flash 技术说明,将它定位为 GLM-5 家族首个原生多模态模型。公告称模型总参数 3200 亿、每次计算激活约 180 亿参数,训练数据覆盖文本与视觉信息;目标是在编程、工具使用、视觉理解和专业任务上提高能力,同时控制推理开销。阅读 AutoClaw 官方技术说明。

Z.ai / AutoClaw 官方标识
Z.ai / AutoClaw 官方标识;点击图片查看公告原文。

架构变化代表什么

“总参数”描述模型整体规模,“激活参数”描述处理一次请求时实际参与计算的部分。GLM-5.3-Flash 将稀疏注意力与线性注意力组合:前者检索较远上下文,后者处理局部依赖。Z.ai 还介绍长上下文索引压缩,并公布与 GLM-5.3 的注意力计算量、KV 缓存占用对比。这些是架构效率指标,不等同于整套服务的端到端延迟或成本;实际结果仍受推理框架、量化、批量和硬件影响。

原生视觉支持能做什么

公告称模型可理解文本、图片、视频与文件,包括图表、文档版面和界面状态。可以测试让同一模型读取截图或含图表的材料,再把发现交给工具执行。但“支持视觉”不保证 OCR、细节识别或时间顺序判断无误;涉及金额、医疗信息或界面关键状态时,应回看原始文件逐项核对。

自托管评估步骤

  1. 从 Z.ai 官方模型页核实可下载权重、许可证、精度和硬件要求。
  2. 用 SGLang 或 vLLM 等官方列出的框架搭建隔离环境,记录版本、量化和上下文长度。
  3. 准备代码、图表、截图、长文档与工具任务,分别测回答质量、显存、吞吐和延迟。
  4. 若接入 Agent,单独验证读屏、选工具与权限行为,不要用榜单分数作上线验收。

180 亿激活参数不代表只需容纳 180 亿参数的显存。推理仍需存放或分布完整权重,并为 KV 缓存、视觉 token 和并发请求留空间。官方称权重采用 MIT 许可;商用前仍应查看当前模型仓库的 LICENSE、权重文件与第三方依赖条款。