#AI
NVIDIA Groq 3 LPX 全面投产
NVIDIA 在 Hot Chips 宣布 Groq 3 LPX 交互式 AI 推理加速器进入全面投产,这是 **Vera Rubin 平台**的扩展,也是该公司去年 12 月以 200 亿美元收购 Groq 之后最大手笔商业化的落地。
NVIDIA 称该产品专为 agentic AI 设计,通过在片上集成 500 MB SRAM 降低内存瓶颈,加速高上下文、低延迟场景下的 token 生成。
💡 为什么值得看NVIDIA 史上最大收购的技术正式商业化,3400 tokens/s 刷新 agentic 推理速度纪录,低延迟推理竞争升温。
低延迟推理竞争格局
| 平台 | 定位与状态 |
|---|---|
| NVIDIA Groq 3 LPX | 全面投产,3,400 tokens/s,主攻 agentic 低延迟推理 |
| OpenAI Ultrafast | 750 tokens/s,由 Cerebras 提供算力 |
| AMD + Cerebras | 已宣布合作聚焦低延迟推理,Cerebras 近期上市 |
低延迟推理成为独立的竞争赛道,云厂商可用此类芯片为延迟敏感型 token 提供溢价服务。
查证
来源与可信度
强
· Groq 3 LPX 在 Artificial Analysis 基准测试中跑出 3,400 tokens/s 的生成速度,创下该模型最快记录,是最近替代方案的 4 倍响应速度。
[1][2]
孤证
· NVIDIA 去年 12 月以 200 亿美元收购 Groq 初创公司资产,这是该公司历史上最大的一笔收购。
[2]
延伸阅读
CNBC 引述 NVIDIA 高管观点,解释了为何云厂商能对延迟敏感型 token 收取更高价格,对理解该赛道的商业逻辑有价值
官方稿详述了跨 7 颗芯片与 5 种机架的 codesign 方案,适合关注 AI 基础设施的技术读者