#AI
Gemini Robotics 2 发布,实现全身控制
Google DeepMind 发布 Gemini Robotics 2,称为迄今最先进的视觉-语言-动作模型。它能将视觉与语言输入直接转换为电机指令,控制从机械臂到人形机器人的多种形态,定位为新一代自适应机器人的“智能层”。
同步推出的 Gemini Robotics ER 2 是更高层推理大脑,取代 4 月发布的 ER 1.6,可理解物理环境、规划多步骤任务并协调多机器人协作。ER 2 已集成 Gemini Live API,开发者可在 AI Studio 体验;演示中 Apptronik 人形机器人展示了全身智能与双手灵巧操作。
技术方面,ER 2 能处理机器人摄像头实时视频流并持续追踪任务进度,其视频帧完成度分类准确率接近 60%,较上代和竞品有显着提升。
💡 为什么值得看第二代 VLA 模型升级至全身智能,具身推理模型 ER 2 同步开放,具身 AGI 向前一步。
查证
来源档案
The Decoder
德国 AI 垂直媒体,本文直接转载 Google DeepMind 官方公告内容。
信息源自 Google 官方博客,可信度较高;但媒体文章可能省略技术细节与限制说明。
延伸阅读
访问 DeepMind 官方页面获取 Gemini Robotics 技术说明与演示视频。