#AI
Gemini Robotics 2.0 发布 支持人形机器人全身控制
Google DeepMind 发布 **Gemini Robotics 2.0** 系列模型,将 AI 控制范围从人形机器人上半身扩展至全身,支持走路、下蹲、弯腰取物等全身协调动作。2.0 打通从指尖到脚底的完整运动链,Apptronik 的 Apollo 2 机器人已能取下架子上的棒球手套、拾起洒水壶。
内核升级包含三块模型:**Gemini Robotics ER 2** 是高层次推理的视觉语言模型,可处理连续视频流、理解任务进展并在失败时自动重试单步,并支持多机器人协作,如 Apollo 2 和 Franka F3 Duo 协同清理车库。
💡 为什么值得看从半身到全身控制,机器人的步伐、蹲起和灵巧手被同一模型打通,离完整的物理 AGI 又近了一步。
关键性能指标
- **视频任务进度分类准确率**:57.4%,优于上一代 1.6 及竞品模型
- **关键瞬间识别准确率**:91.3%,平均时间偏差仅 0.96 秒——以 4 倍执行速度、更低算力成本,达到与更大模型相当的水平
- **灵巧手操作**:支持复杂的五指手,可以封口密封袋、系垃圾袋、拧下灯泡
- **本地模型适配**:On-Device 2 可在数小时、约 200 个动作例基础上,适应形态、传感器和自由度差异很大的新硬件
查证
来源与可信度
强
· Gemini Robotics ER 2 正式开放,指标与基准数据来自 Google DeepMind 官方博客。
[1]
强
· The Verge 和 Ars Technica 同步报道,补充了实际场景、硬件形态与安全基准的独立解读
[3]
弱
· 通用版 Gemini Robotics 2 和 On-Device 2 仍限制测试,未公开,后续迭代待观察。
另有 1 个来源跟进
延伸阅读
官方博客给出完整的技术指标、协作场景代码仓库链接和波士顿动力 Spot 集成演示,想复现或评估的工程师必读
The Verge 的解读侧重消费级人形机器人可能带来的日常应用变化,适合快速理解产品边界
Ars Technica 拉取了竞品对比图表(分类准确率、安全基准),直接展示了模型真实的优劣势