探所 Curio 再探再报 了解探所 →
#AI

NVIDIA Groq 3 LPX 全面投产

NVIDIA 在 Hot Chips 宣布 Groq 3 LPX 交互式 AI 推理加速器进入全面投产,这是 **Vera Rubin 平台**的扩展,也是该公司去年 12 月以 200 亿美元收购 Groq 之后最大手笔商业化的落地。

NVIDIA 称该产品专为 agentic AI 设计,通过在片上集成 500 MB SRAM 降低内存瓶颈,加速高上下文、低延迟场景下的 token 生成。

💡 为什么值得看NVIDIA 史上最大收购的技术正式商业化,3400 tokens/s 刷新 agentic 推理速度纪录,低延迟推理竞争升温。

低延迟推理竞争格局

平台定位与状态
NVIDIA Groq 3 LPX全面投产,3,400 tokens/s,主攻 agentic 低延迟推理
OpenAI Ultrafast750 tokens/s,由 Cerebras 提供算力
AMD + Cerebras已宣布合作聚焦低延迟推理,Cerebras 近期上市

低延迟推理成为独立的竞争赛道,云厂商可用此类芯片为延迟敏感型 token 提供溢价服务。

查证

来源与可信度

· NVIDIA 在 Hot Chips 宣布 Groq 3 LPX 交互式 AI 推理加速器进入全面投产,这是 Vera Rubin 平台的扩展。 [1][2]
· Groq 3 LPX 在 Artificial Analysis 基准测试中跑出 3,400 tokens/s 的生成速度,创下该模型最快记录,是最近替代方案的 4 倍响应速度。 [1][2]
· Nebius 成为首家采用 Groq 3 LPX 的 AI 云厂商,将通过其 Token Factory 平台提供该算力,今年晚些时候上线。 [1][2]
孤证 · NVIDIA 去年 12 月以 200 亿美元收购 Groq 初创公司资产,这是该公司历史上最大的一笔收购。 [2]

延伸阅读

低延迟推理作为溢价商业模式的分析 · cnbc.com
CNBC 引述 NVIDIA 高管观点,解释了为何云厂商能对延迟敏感型 token 收取更高价格,对理解该赛道的商业逻辑有价值
Vera Rubin 平台的完整技术架构 · nvidianews.nvidia.com
官方稿详述了跨 7 颗芯片与 5 种机架的 codesign 方案,适合关注 AI 基础设施的技术读者
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store