#AI
8 卡 PCIe 整机跑出 6.87 倍推理提速
是石科技(Metastone)在单台 8 卡 PCIe-Only 整机上,把 DeepSeek-V4.1-Flash 输入吞吐从 1932 tok/s 提到 13274 tok/s,合 6.87 倍,1M 上下文仍可支持。
提效分两步:先内核补齐,吞吐到 5850 tok/s;再经算子融合、计算通信重叠与并行调优,推到 13274 tok/s。
「1.5 台 6000D 跑赢 1 台 B300」有前提,指视频生成叠加缓存复用;文本推理上 B300 输入吞吐约为其 4.9-5.6 倍。
💡 为什么值得看软件优化榨出 6.87 倍吞吐,「能跑」与「可用」的差距被量化。
查证
来源与可信度
强
· 是石科技 Meta-Infer 在单台 8 卡 PCIe-Only 整机上,把 DeepSeek-V4.1-Flash 输入吞吐从 1932 tok/s 提升到 13274 tok/s,合 6.87 倍。
[1][2]
延伸阅读
内核补齐、算子与通信重构、并行容量调优、缓存复用四层写得很细,工程团队可直接照搬思路。
作者把省下的注意力换成了算力,也点出推理下沉到合法可采买硅片后,出口管制问题会收窄到训练侧。