#AI
英伟达 Lightning 模型上线 SageMaker
NVIDIA Nemotron 3.5 Lightning 正式上线 Amazon SageMaker JumpStart,用户无需自行配置推理基础设施即可从模型卡片一键部署。
这是一款面向高吞吐 agent 工作负载的开源模型,从 NVIDIA 旗舰 Nemotron 3 Ultra 蒸馏而来,采用混合 MoE 架构,30B 总参数每步只激活 3B,单块受支持 GPU 即可运行,省去了前沿级基础设施。
💡 为什么值得看30B 参数只激活 3B,专供高吞吐 agent 场景,号称吞吐提升 4 倍、任务完成快 30%。
查证
来源档案
AWS Machine Learning Blog
AWS 官方博客,由 AWS 与厂商共同发布的模型上线公告,带完整部署教程与基准表。
官方一手源,部署事实与模型规格可完全采信;但 4 倍吞吐、30% 提速等性能数字来自 NVIDIA 自报,需保留'厂商声称'的不确定性口径。
延伸阅读
给跨平台部署用户看具体步骤:Studio 界面、Hugging Face 页面与 Python SDK 三条路径,以及 ml.g6e/ml.p4d/ml.p5 三种实例选型。
BF16 与 NVFP4 在 MMLU Pro、GPQA Diamond、SWE-bench Verified 等六项基准的对照,量化损失到底有多大一目了然。
原文列了个人助理、金融、网安、电信、零售五类高频 agent 场景,适合做'小模型承担大调用量'的系统化设计参考。