#AI
llama.cpp 合入 GLM-5.3-Flash 支持
llama.cpp 于 9 月 30 日合入 PR 27773,为 Z.ai 的 GLM-5.3-Flash 增加本地推理路径。该 MIT 许可模型权重最早于 8 月 26 日上传。
官方 Hugging Face 仓库占 328 GB,共 62 个 Safetensors 分片,模型卡描述约 3200 亿总参数、180 亿激活参数;已核对的材料未给出跑通完整 checkpoint 所需的最低或推荐显存。
💡 为什么值得看Z.ai 多模态模型多了本地运行路径,但仓库 328 GB,装不下。
查证
来源档案
Ground Truth
聚合型科技资讯站,本篇按「已验证事实清单 + 关键问答」结构整理,自称核对了一手材料。
二手整理,但把事实与推断分开写,且明确标注缺失信息(如未给显存要求)。PR 号、仓库体积等具体数字未见第二家独立源互证,按单一来源对待。
延伸阅读
想真正跑起来的人,应该先去看 PR 27773 的合并状态,再找社区量化版本的实际显存占用,而不是照搬 328 GB 这个仓库数字。
「激活参数少 = 硬件门槛低」是本地部署里最常见的误读,这篇把存储预算和计算预算拆开讲了,值得一读。