#AI
SemiAnalysis 开源 AgentX 推理基准
SemiAnalysis 发布 **AgentX 1.0**,这是首个完全开源、Apache 2.0 许可、支持百万上下文的多轮 agentic 编码推理基准。它补上了此前以固定串行长度预填/解码为主的评测盲区,用真实 Claude Code 流量回放来检验生产级推理性能。
基准在约 2MW 连续算力、超 1000 块芯片上运行,覆盖 MI355X、GB300 NVL72、B200、H200 等 SKU。初步结论是 NVIDIA 在多数前沿模型上占优,AMD 在特定对比中也有亮点,但 CUDA 在真实 agentic 工作负载下的护城河仍需更多模型验证。完整数据集与榜单已开源,具体数据见原文。
💡 为什么值得看首个百万上下文的开源 agentic 推理基准,直接检验 CUDA 护城河在真实多轮工作负载下是否还成立。
查证
来源档案
SemiAnalysis
行业深度研究机构订阅通讯,一手发布的自家基准数据
官方一手发布,数据与榜单由 SemiAnalysis 自己运行并开源,可信度高;但其对 NVIDIA/AMD 的胜负解读带机构立场,且部分模型(如 B300)为厂商优化版本,结论需看具体配置。
延伸阅读
文章内核命题是 agentic 推理下 CUDA 生态优势是否仍然成立,多轮长上下文对 KV cache、路由、显存分层提出新要求,比单一 token 吞吐更能暴露软硬件协同差异。
AgentX 用 393 条匿名 Claude Code trace 回放并重放请求调度,配合 Anthropic 修复的两个功能,想评估真实生产流量而非 benchmax 图像,方法论本身值得细读。