#AI
Kimi K3 全量 2.8T 在 M5 Max 本机跑通
一个 GitHub 项目用单一原生二进制 Deltafin,把 Moonshot 发布的完整 Kimi K3(2.8T 参数 MoE,约 1.45TB 专家权重)跑在了一台 **M5 Max MacBook Pro(128GB)** 上,专家权重通过**四块 SSD 流式加载**,没有剪枝、没有量化。
实测稳态解码约 **1 token/s**(drafter 开启、512 token 输出),128 token 输出可达 1.13 token/s。作者也坦承了瓶颈:512 token 提示词要等约 6.3 分钟才出首 token,原因是 prefill 对每层专家重复读取 8 次,修复方案已规划但未实现。四块盘里单盘速度约为四盘的 52%,说明瓶颈在单层最慢的读取而非总带宽。
💡 为什么值得看K3 完整版首现消费单机 1 token/s,具部署参考价值。
查证
来源档案
argonautlabsai/deltafin
GitHub 开源项目 README 及基准文档,由开发者自测自报,属于社区一手实测而非媒体二手转述。
数据由项目作者自己跑自己公开,无第三方复核;但其主张克制(明确标出冷跑、逐 run 日志可供复现),可信度中偏高,仍属单源。
延伸阅读
README 指向 PREFILL.md,解释了 prefill 重复读专家 8 次的原因与计划中的修复方向,想理解瓶颈本质可看。
SCALING.md 记录了 1-4 块盘的加速阶梯,说明是每层 16 次读取中最慢的一次决定节奏,而非总带宽。