探所 Curio 再探再报 了解探所 →
#AI

英伟达披露 Vera Rubin NVL72 实测数据

英伟达首次公布下一代旗舰机柜 **Vera Rubin NVL72** 的实测性能。在 SemiAnalysis AgentX 基准上、搭载 DeepSeek-V4-Pro 等模型执行真实智能体编码任务时,该机柜**每兆瓦吞吐量较现役 GB300 NVL72 最高提升 30 倍**,Token 成本最高降低 35 倍。

关键在基准的性质:AgentX 采用真实智能体编码会话记录,保留上下文增长、工具调用与子代理生成,而非传统聊天的 1K-8K 固定串行。据 OpenRouter 数据,代理式工作负载消耗的 Token 是简单聊天的约 15 倍,会话上下文可累积至数十万输入 token。能效指标因此直接对应「同功耗下多干 30 倍的代理活」。

💡 为什么值得看官方首次公布下一代机柜实测:代理任务每兆瓦吞吐较 GB300 最高 30 倍,Token 成本最高降 35 倍,直接影响 AI 工厂算力决策。

查证

来源与可信度

· 英伟达首次公布下一代旗舰机柜 Vera Rubin NVL72 的实测数据,显示其每兆瓦吞吐量较现役 GB300 NVL72 最高提升 30 倍。 [1][2]
· 该实测基于 SemiAnalysis 的 AgentX 工作负载,采用真实智能体编码会话记录(保留上下文增长、工具调用与子代理生成),搭载 DeepSeek-V4-Pro 等模型执行。 [1][2]
· 在代理任务上 Vera Rubin NVL72 的 Token 成本较 GB300 NVL72 最高降低 35 倍。 [1][2]
孤证 · 该数据是早期硅片实测结果,英伟达称随软件优化,Vera Rubin NVL72 与 GB300 NVL72 的性能都将继续提升。 [2]

延伸阅读

分型号数据对照 · link.baai.ac.cn 约 5 分钟
原文列出 Kimi K3、MiniMax M3、GLM5.3、Qwen3.5、DeepSeek V4 Pro 等多模型在 AgentX 上的表现,想对比国产模型在新硬件上的能效差异,直接看图表更有信息量。
AgentX 指标定义 · blogs.nvidia.com 约 8 分钟
E2E 交互性与标准交互性、TTFT、E2E 延迟四项指标如何区分「吞吐大但不实用」,官方技术博客有完整定义与测法说明。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store