#AI
英伟达披露 Vera Rubin NVL72 实测数据
英伟达首次公布下一代旗舰机柜 **Vera Rubin NVL72** 的实测性能。在 SemiAnalysis AgentX 基准上、搭载 DeepSeek-V4-Pro 等模型执行真实智能体编码任务时,该机柜**每兆瓦吞吐量较现役 GB300 NVL72 最高提升 30 倍**,Token 成本最高降低 35 倍。
关键在基准的性质:AgentX 采用真实智能体编码会话记录,保留上下文增长、工具调用与子代理生成,而非传统聊天的 1K-8K 固定串行。据 OpenRouter 数据,代理式工作负载消耗的 Token 是简单聊天的约 15 倍,会话上下文可累积至数十万输入 token。能效指标因此直接对应「同功耗下多干 30 倍的代理活」。
💡 为什么值得看官方首次公布下一代机柜实测:代理任务每兆瓦吞吐较 GB300 最高 30 倍,Token 成本最高降 35 倍,直接影响 AI 工厂算力决策。
查证
来源与可信度
强
· 该实测基于 SemiAnalysis 的 AgentX 工作负载,采用真实智能体编码会话记录(保留上下文增长、工具调用与子代理生成),搭载 DeepSeek-V4-Pro 等模型执行。
[1][2]
孤证
· 该数据是早期硅片实测结果,英伟达称随软件优化,Vera Rubin NVL72 与 GB300 NVL72 的性能都将继续提升。
[2]
延伸阅读
原文列出 Kimi K3、MiniMax M3、GLM5.3、Qwen3.5、DeepSeek V4 Pro 等多模型在 AgentX 上的表现,想对比国产模型在新硬件上的能效差异,直接看图表更有信息量。
E2E 交互性与标准交互性、TTFT、E2E 延迟四项指标如何区分「吞吐大但不实用」,官方技术博客有完整定义与测法说明。