时间:2026年7月30日
地点:英国伦敦 / 美国山景城(Google DeepMind总部)
人物:Google DeepMind(Google旗下AI研究实验室)、Steven Hansen(高级首席软件工程师)、Peng Xu(主任软件工程师)、Apptronik(人形机器人公司,Apollo 2制造商)、Boston Dynamics(波士顿动力,仪器读取能力合作方)
事件详情:Google DeepMind于7月30日正式发布Gemini Robotics 2机器人AI系统及核心组件Gemini Robotics ER 2具身推理模型。新系统将1个视觉语言模型(VLM)与2个视觉语言动作模型(VLA)整合,使机器人能在统一智能框架下完成全身动作控制。ER 2可接受视频、图像、音频与文本输入,进行长程任务规划,并可调用Google Search等外部工具;其底层基于Gemini 3.5 Flash,配备12.8万token上下文窗口与最高6.4万token输出。系统已通过Gemini API、Google AI Studio向开发者开放,并在Gemini Enterprise Agent Platform上提供私测。
背景:Gemini Robotics 2是DeepMind机器人路线的最新里程碑。今年4月14日DeepMind已发布Gemini Robotics-ER 1.6版本,新增工业仪表读取能力,并联合波士顿动力在现代汽车工厂开展试点。本次升级重点是引入连续视频流推理与多机协作能力,让机器人能判断”任务是否完成”、并在共享空间中协同完成单体难以独立执行的复杂工作流。Apptronik的Apollo 2人形机器人搭配Sharpa机械手已在DeepMind演示中实现货架整理、灯泡拧紧、垃圾袋系扎等全身精细操作。
影响:
– DeepMind将”视频流判断+多机协作+工具调用”整合进同一推理模型,对标Anthropic、OpenAI在对话与编程领域的领先地位,凸显Google在机器人研究上的差异化优势;
– Apptronik、Boston Dynamics等硬件合作方将获得新一代”机器人大脑”,工业巡检、仓储、家用服务等多场景的机器人自主能力有望进一步提升;
– 128K上下文+多模态工具调用使机器人可执行分钟级长程任务,企业级Agent与物理AI融合的门槛进一步降低。
总结:Gemini Robotics 2延续了DeepMind自Say-Can、PaLM-SayCan以来的机器人研究积累,把”具身推理”从单步感知拓展到连续视频判断与多机协同,是2026年下半年机器人基础模型竞争的关键卡位。对国内厂商而言,Apptronik+Sharpa的人形机器人方案、Apptronik的工业落地经验以及DeepMind开放API都为具身智能玩家提供了清晰的对标路径。
参考来源:
– https://www.wired.com/story/google-gemini-can-control-humanoid-robots/
– https://deepmind.google/blog/gemini-robotics-er-2-powering-robotics-with-video-understanding-task-orchestration-and-multi-robot-collaboration/
– https://blog.google/innovation-and-ai/models-and-research/google-deepmind/gemini-robotics-er-2/
– https://www.unite.ai/google-ships-gemini-robotics-er-2-with-multi-robot-teamwork/
– http://news.10jqka.com.cn/20260730/c678564773.shtml
– https://baijiahao.baidu.com/s?id=1872153456270128923&wfr=spider&for=pc