-
aaideit_admin 管理员
谷歌DeepMind发布Gemini Robotics 1.5,机器人AI新突破
2025年9月25日,谷歌DeepMind发布Gemini Robotics 1.5系列模型,推动具身智能迈向实用化。
双模型架构
Gemini Robotics-ER 1.5(高层大脑):
- 视觉-语言模型(VLM)
- 环境理解、规划与决策
- 原生调用Google Search等工具
- 15项学术基准SOTA
Gemini Robotics 1.5(执行者):
- 视觉-语言-动作(VLA)模型
- 将指令转化为运动命令
- "思考后行动"能力
- 跨躯体学习迁移
核心能力
先思考后行动:
- 生成内部推理序列
- 透明化决策过程
- 提升任务成功率
多步骤任务:
- 垃圾分类:查阅规则→生成计划→执行操作
- 衣物分类:理解指令→逻辑判断→精确动作
应用场景
制造、物流、家庭服务等需要复杂多步骤操作的场景。
模型已开放给开发者通过Gemini API使用。
本文源自「Google DeepMind官方博客」