探所 Curio 再探再报 了解探所 →
#AI

8 卡 PCIe 整机跑出 6.87 倍推理提速

是石科技(Metastone)在单台 8 卡 PCIe-Only 整机上,把 DeepSeek-V4.1-Flash 输入吞吐从 1932 tok/s 提到 13274 tok/s,合 6.87 倍,1M 上下文仍可支持。

提效分两步:先内核补齐,吞吐到 5850 tok/s;再经算子融合、计算通信重叠与并行调优,推到 13274 tok/s。

「1.5 台 6000D 跑赢 1 台 B300」有前提,指视频生成叠加缓存复用;文本推理上 B300 输入吞吐约为其 4.9-5.6 倍。

💡 为什么值得看软件优化榨出 6.87 倍吞吐,「能跑」与「可用」的差距被量化。

查证

来源与可信度

强 · 是石科技 Meta-Infer 在单台 8 卡 PCIe-Only 整机上,把 DeepSeek-V4.1-Flash 输入吞吐从 1932 tok/s 提升到 13274 tok/s,合 6.87 倍。 [1][2]
强 · 提升分两阶段:内核补齐后先到 5850 tok/s,再经算子融合与通信重构到 13274 tok/s,全程不改模型结构。 [1][2]
强 · 同口径下 B300 文本输入吞吐约为这台 8 卡整机的 4.9-5.6 倍(DeepSeek-V4-Flash),差距缩小但未闭合。 [1][2]
强 · 「1.5 台 6000D 跑赢 1 台 B300」只适用于叠加缓存复用的视频生成场景,不适用于文本推理。 [1][2]

延伸阅读

四项优化的具体做法 · qbitai.com 10 分钟
内核补齐、算子与通信重构、并行容量调优、缓存复用四层写得很细,工程团队可直接照搬思路。
这个数字意味着什幺 · chinaaidispatch.substack.com 6 分钟
作者把省下的注意力换成了算力,也点出推理下沉到合法可采买硅片后,出口管制问题会收窄到训练侧。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 目前邀请测试中