#AI
斯坦福 Caltech 让 GPT-6 Astra 直驱人形机器人
斯坦福与 Caltech 的研究者做了一个叫 HomeBody 的系统:一台 Unitree G1 人形机器人能自己走进一间不熟悉的厨房,把东西收拾好,并从抽屉里取物。他们砍掉了语言模型与机器人之间那层专门训练的控制层,改用可替换的视觉语言模型——这次是 GPT Astra——**直接调用抓取、导航、开抽屉这些模块化技能**。
流程上,机器人先探索房间,在 Nvidia 的 Isaac Sim 里建一份数字孪生,把物体和位置记进空间记忆,所以东西离开视野后它还能找到。遇到「收拾厨房」这种任务,语言模型逐步规划并在出错时自我纠正。论文报告的限制也很实在:Astra 的延迟、手指舵机过热、算力成本偏高,代码放在 GitHub 上。
💡 为什么值得看HomeBody 省去控制层,代价是延迟和算力。
查证
来源档案
The Decoder
面向 AI 从业者的英文科技媒体,对本条做的是研究成果摘要式报道,非原始论文或作者本人陈述。
单一二线媒体来源。具体实验数据、成功率与论文出处均未在正文给出,引用前需回查原论文与开源代码。
延伸阅读
理解「语言模型直调技能库」与主流 VLA 端到端路线的取舍,是这条研究的真正看点。