TechTrends360 科技前沿

聚焦全球科技前沿资讯:AI、芯片、互联网大厂动态,每日更新

人工智能

智谱GLM-5.3-Flash开源:320B原生多模态登场

导语

8月26日晚,智谱(Z.ai)正式发布 GLM-5.3-Flash。这是 GLM-5 系列中首个原生多模态模型:总参数约 320B、激活参数仅 18B,支持 100 万 token 上下文,以 MIT 许可在 Hugging Face 开源权重,API 定价只有旗舰版 GLM-5.3 的约十分之一。更引人注目的是,智谱披露其大规模公测流量全部由国产芯片集群承载——开源、便宜、跑在国产算力上,这款模型把几个热门标签一次集齐。

一次到位的发布:参数、价格、开源三连

GLM-5.3-Flash 的定位很清晰:做”性价比下限”的重塑者。它不是 GLM-5.3(8 月 14 日发布)的蒸馏版,而是更换了注意力机制后重新训练的新基座。核心规格如下:

  • 架构:原生多模态 MoE,总参数约 320B,激活 18B;首个采用稀疏注意力与线性注意力混合架构的开源前沿模型。
  • 输入输出:支持文本、图像、视频、文件输入,文本输出;上下文窗口 100 万 token,最大输出 128K。
  • 效率:相比 GLM-5.3,注意力计算量与 KV 缓存分别降低 3.01 倍和 4.44 倍,并引入 IndexPool 把索引器的 4 个缓存向量压缩为 1 个。
  • 性能:Artificial Analysis 综合智能指数 57 分,与 Claude Opus 4.8 处于同一水位。
  • 价格:API 输入 0.15 美元 / 百万 token、输出 0.50 美元 / 百万 token,约为 GLM-5.3 的十分之一。
  • 开源:MIT 许可,Hugging Face 上同时放出 FP8(约 328GB)与 BF16(约 642.7GB)权重,支持 SGLang、vLLM 等本地部署。

值得一提的是,发布前约 6 天,这款模型曾以匿名代号”Ox Alpha(牛来)”出现在 OpenRouter 与 OpenCode 上接受公开测试,发布时官方才确认其真实身份。

原生多模态:把”眼睛”装进编程循环

“原生多模态”是这次升级的关键词。与外挂视觉模块的方案不同,GLM-5.3-Flash 的视觉能力被直接融进了编程与智能体循环:模型能主动观察界面、渲染结果与交互反馈,并持续修正。官方文档给出的例子颇具冲击力——模型曾自主连续运行 16 小时,在 Blender 里从零搭建出约 400 平方米的专业主厨住宅与测试厨房场景,全程无外部素材。前端开发场景下,它可以把页面截图、网站 URL 或操作录屏直接转成可运行的应用,再逐页截图对比、反复打磨。

同时,GLM-5.3-Flash 已全量接入 GLM Coding Plan(额度提升至 3 倍),智谱还推出了提速版 FlashX,推理速度达到 200 tokens/秒,主打更流畅的交互体验。

国产芯片承载全部公测流量

比参数更让行业侧目的是算力侧的声明:智谱首次在大规模流量中采用国产芯片集群提供 GLM-5.3-Flash 的服务。通过基于 SGLang 构建的专用推理引擎与 EPD 分离式架构,团队克服了单芯片显存容量与带宽限制,撑起了 100 万 token 的长上下文服务。与同一硬件的初始基线相比,端到端服务性能提升 3 倍,硬件效率与单 token 成本已达到主流 Nvidia GPU 相当的水平。更有趣的细节是,整个推理系统的构建过程本身就有 GLM-5.3 驱动的 infra agent 参与加速——”模型优化系统,系统承载模型”,形成了一次闭环。

背景:开源模型的”效率战争”

GLM-5.3-Flash 的发布,正值开源大模型竞争从”堆参数”转向”拼效率”。当各家旗舰模型在智能上限上逐渐收敛,真正的分水岭变成了:同样的智能,能否用更少的激活参数、更低的推理成本、更长的上下文交付。混合注意力架构、KV 缓存压缩、国产芯片推理优化,都是这场效率战争的弹药。智谱选择把 320B 参数的模型以 MIT 许可完全开放,显然意在把生态和开发者心智一起收入囊中。

展望:便宜的智能会改变什么

当一个接近顶级水平的原生多模态模型,价格降到原来的十分之一、权重完全开放、还能跑在国产芯片上,它冲击的不只是 API 市场,更是应用层的想象力:此前因为成本不敢做的长上下文 Agent、高频调用的编程助手、需要视觉反馈的自动化流程,都有了新的经济可行性。当然,挑战同样真实——公测数据的可复现性、内容安全与合规、以及国产芯片在大规模复杂负载下的长期稳定性,都还需要时间验证。但至少这一次,开源社区拿到了一份分量十足的礼物。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注