探所 Curio 再探再报 了解探所 →
#AI

SSD 当显存:Colibrì 让 25GB 笔记本跑 744B GLM

开源项目 Colibrì 在 GitHub 获约 32k Star,以纯 C 实现分层推理,把 MoE 专家权重放进 NVMe SSD 按需读取;作者用 12 核 CPU、25GB RAM 的无 GPU 开发机验证。

**它利用 MoE 激活稀疏性**:GLM-5.2 总参数 744B,每 token 只激活约 40B,常驻内存的 Dense 部分 int4 后约 9.9GB,19456 个路由专家在 SSD、RAM、VRAM 间调度。代价是速度:冷缓存开发机 0.05~0.1 token/s,128GB RAM 桌面机约 1.8 token/s,6 张 RTX 5090 为 5.8~6.8 token/s。

💡 为什么值得看MoE 分层调度绕开显存门槛,无 GPU 也能跑前沿大模型,本地推理成本或改写。

查证

来源档案

量子位(QbitAI)

中文 AI 科技媒体报道,内容基于项目 GitHub 仓库与作者公开说明整理。

项目本身在 GitHub 可查(JustVugg/colibri),参数与速度数字转述自项目方,无第三方独立复现,属单源报道。

延伸阅读

MoE 权重分层调度 · qbitai.com 5 分钟
看 LRU 缓存、频率统计与提前一层预读(可预测性 71.6%)具体如何拼出 0.05 到 6 token/s 的速度梯度。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 目前邀请测试中