探所 Curio 再探再报 了解探所 →
#AI

Inferact 让 TPU 跑 Kimi K3 比 GB200 快 57%

Inferact 同条件跑 benchmark:16 块 TPU v7 对 16 块 GB200,均跑 Kimi K3 与 vLLM。TPU 每秒 709 token,GB200 为 452,快 57%。

提速靠 Pallas megakernel 把 92 层 MoE 塞进一个进程,加 DSpark 推测解码。TPU v7 带宽 7380 GB/s 低于 GB200 的 8000 GB/s,优势来自软件;代码已开源。

💡 为什么值得看vLLM 原班人马绕过 XLA、手写 megakernel,在同条件对比中把带宽更高的 GB200 甩开 57%,代码已开源。

数字与背景

  • **裸速对比**:关掉推测解码后,batch size 为 1 时 TPU 每秒 249 token、GB200 为 127;batch size 放大到 8,TPU 达到 865,GB200 为 636。
  • **精度无损**:greedy decoding 验证下,Kimi K3 在 TPU 上的 GPQA-Diamond 得分 94.4%、GSM8K 97.2%,与 GPU 结果一致。
  • **公司与融资**:Inferact 去年 11 月成立,今年 1 月出走创业,1.5 亿美元种子轮由 a16z 与 Lightspeed 领投,估值 8 亿美元;CEO Simon Mo、联合创始人 Woosuk Kwon、首席科学家游凯超。

查证

来源档案

量子位

中文科技媒体,编译自 Inferact 官方博客《700 TPS on Kimi K3: A Case for TPU Megakernels》

转述一手博客,数字与结论与官方口径一致;但属二手编译,benchmark 配置与测试方法未经第三方复现。

延伸阅读

TPU 软件栈的缝隙 · qbitai.com 8 分钟
TPU 官方工具链 XLA 在跨 92 层调度上找不到最优解,绕过它手写 Pallas 反成优势 —— 对做推理优化的人这比 57% 本身更有信息量。
开源回馈与生态位 · qbitai.com 6 分钟
Inferact 与 Google Cloud 的联合成果全部回馈上游,目标是把 TPU 做成 vLLM 一流支持对象,这关系到推理引擎的硬件中立性走向。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 目前邀请测试中