探所 Curio 再探再报 了解探所 →
#AI

SemiAnalysis 实测 Vera Rubin:每美元吞吐量领先 GB300 最高 67 倍

SemiAnalysis 发布了 Vera Rubin NVL72 的首批第三方 agentic 推理实测:在其自研 AgentX 基准上,**每美元总吞吐量最高达到 GB300 的约 67 倍**(170 TPS、按自购拥有成本口径)。更贴近真实服务场景的 60-100 TPS 区间,Rubin 也仍有 **1.4 至 3 倍**的优势。

该机构还指出,黄仁勋在 GTC 2026 上按大模型 200 TPS 口径只讲了 Blackwell 的 3 倍每兆瓦性能,而预发布软件上的实测已到约 7 倍,并翻出 GTC 2024 那次「说 30 倍、实测 98 倍」的旧账,称 NVIDIA 一贯把性能讲保守。

💡 为什么值得看第三方实测称 NVIDIA 在 GTC 讲保守了,推理经济性差距决定买谁家的卡。

关键数字(第三方实测)

  • **每美元吞吐**:170 TPS 下约为 GB300 的 67 倍;60-100 TPS 真实服务区间为 1.4-3 倍。
  • **每兆瓦吞吐**:100 TPS 时约 5940 万 tok/s/MW,为 GB300 Dynamo SGLang 的约 2.09 倍;150 TPS 时约为 7.2 倍, 200 TPS 时收窄到 2.72 倍。
  • **对标老卡**:同一 agentic 场景下,Rubin 相对 H200 的每美元 token 优势在 80 TPS 为 18 倍、120 TPS 拉大到 39 倍。

官方只公布了平台构成与量产状态,没有给出可比口径的每美元数字;上表全部来自第三方基准,数字随服务引擎与 SLA 目标变化较大。

查证

来源与可信度

孤证 · Vera Rubin NVL72 在 170 TPS 下,每美元总吞吐量约为 GB300 的 67 倍(SemiAnalysis 自购拥有成本口径)。 [1]
孤证 · 在实际主流服务区间(60-100 TPS),Rubin 每美元吞吐量约为最新 GB300 TRTLLM 配置的 1.4 至 3 倍。 [1]
孤证 · SemiAnalysis 称预发布软件下 Rubin 每兆瓦 token 吞吐已达 Blackwell 的约 7 倍,高于 GTC 2026 上黄仁勋公布的 3 倍。 [1]
孤证 · NVIDIA 官方称 Vera Rubin 平台包含七款芯片并已进入量产,集成 Vera CPU、Rubin GPU、NVLink 6、ConnectX-9… [2]

延伸阅读

成本假设怎幺定倍数 · newsletter.semianalysis.com 15 分钟
同一批数据在自购拥有、三年租约、不同 TPS 目标下倍数差异极大,想引用这些数字的人应该先看它给的成本口径和 TCO 模型输入。
平台构成与量产状态 · nvidianews.nvidia.com 5 分钟
想知道具体是哪七款芯片、五类机柜如何成套交付,以及哪些客户已在采用名单上,官方公告是最省时的入口。
Vera CPU 单独落地形态 · nvidianews.nvidia.com 6 分钟
Vera 同时以独立 CPU 平台和 Vera Rubin 系统组成部件两种形态出货,官方产品页给了双路、单路与整机柜配置的具体规格。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 目前邀请测试中