谷歌DeepMind发布Gemini Robotics 1.5,机器人AI新突破

2025年9月25日,谷歌DeepMind发布Gemini Robotics 1.5系列模型,推动具身智能迈向实用化。

双模型架构

Gemini Robotics-ER 1.5(高层大脑)

  • 视觉-语言模型(VLM)
  • 环境理解、规划与决策
  • 原生调用Google Search等工具
  • 15项学术基准SOTA

Gemini Robotics 1.5(执行者)

  • 视觉-语言-动作(VLA)模型
  • 将指令转化为运动命令
  • "思考后行动"能力
  • 跨躯体学习迁移

核心能力

先思考后行动

  • 生成内部推理序列
  • 透明化决策过程
  • 提升任务成功率

多步骤任务

  • 垃圾分类:查阅规则→生成计划→执行操作
  • 衣物分类:理解指令→逻辑判断→精确动作

应用场景

制造、物流、家庭服务等需要复杂多步骤操作的场景。

模型已开放给开发者通过Gemini API使用。

本文源自「Google DeepMind官方博客