#AI
SSD 当显存:Colibrì 让 25GB 笔记本跑 744B GLM
开源项目 Colibrì 在 GitHub 获约 32k Star,以纯 C 实现分层推理,把 MoE 专家权重放进 NVMe SSD 按需读取;作者用 12 核 CPU、25GB RAM 的无 GPU 开发机验证。
**它利用 MoE 激活稀疏性**:GLM-5.2 总参数 744B,每 token 只激活约 40B,常驻内存的 Dense 部分 int4 后约 9.9GB,19456 个路由专家在 SSD、RAM、VRAM 间调度。代价是速度:冷缓存开发机 0.05~0.1 token/s,128GB RAM 桌面机约 1.8 token/s,6 张 RTX 5090 为 5.8~6.8 token/s。
💡 为什么值得看MoE 分层调度绕开显存门槛,无 GPU 也能跑前沿大模型,本地推理成本或改写。
查证
来源档案
量子位(QbitAI)
中文 AI 科技媒体报道,内容基于项目 GitHub 仓库与作者公开说明整理。
项目本身在 GitHub 可查(JustVugg/colibri),参数与速度数字转述自项目方,无第三方独立复现,属单源报道。
延伸阅读
看 LRU 缓存、频率统计与提前一层预读(可预测性 71.6%)具体如何拼出 0.05 到 6 token/s 的速度梯度。