DeepMind 扩展其机器人叙事
Google DeepMind 推出了 Gemini Robotics 2,将其定位为从局限于机械臂或桌面操作的机器人系统,迈向更广泛全身自主能力的一步。据 The Robot Report 报道,这款更新后的视觉-语言-动作模型加入了智能全身控制、更强的灵巧性,以及多机器人协同工作的支持。
这一发布之所以重要,是因为它针对的是机器人领域一个长期存在的缺口。许多系统可以在受限环境中完成精心安排的操作任务,但能把感知、语言理解和整个人形身体上的协调运动结合起来的系统要少得多。DeepMind 的主张是,Gemini Robotics 2 通过让机器人将行走、下蹲、伸展和搬运物体等动作作为同一任务的一部分进行推理,进一步接近了这一门槛。
这并不意味着通用人形机器人已经到来。报道谨慎指出,运动速度仍需要提升。但它将这次发布描述为一个重要步骤,即把多模态 AI 从桌面演示层推进为更现实物理工作的控制器。
从上半身演示走向全身动作
DeepMind 早期的模型主要聚焦于桌面任务中的上半身控制。相比之下,Gemini Robotics 2 被描述为能够管理机器人的整个身体。The Robot Report 说,该系统可以将用户意图转化为协调的全身运动,使人形机器人能够在空间中移动,并完成同时涉及行走和操作的任务。
报道中的一个例子使用了 Apptronik 的 Apollo 2 人形机器人。当被指示把一个喷壶放到下层架子上的绿色箱子里时,机器人被描述为会理解请求,走到桌子旁,拿起物体,穿过房间并将其放到目标位置。这个过程之所以引人注意,不是因为其中任何单一步骤前所未有,而是因为它把自然语言指令、物体搬运、行走和精确放置合并成了一个连续行为。
如果这些能力在受控演示之外也足够稳健,它们将标志着人形平台可尝试的任务范围有了实际扩展。仓库、实验室和服务场景往往需要的正是这种机动性与操作能力的组合,而不是固定工位上的孤立手臂动作。
灵巧性和协作是另外两个重点
DeepMind 还强调了更精细的运动控制。The Robot Report 称,Gemini Robotics 2 可以控制 Apollo 2 上五指、22 自由度的 SharpaWave 机械手。这表明该公司不仅在研究粗大运动,也在研究有用抓取和放置所需的更细腻的手指与手部动作。
灵巧性仍然是现实世界机器人最难的部分之一。即使机器人能走到房间另一端,如果它不能可靠地抓取混合物体、正确调整姿态并与杂乱环境互动,其价值仍然有限。通过突出先进的手部控制,DeepMind 传递的信号是,它希望自己的机器人技术栈覆盖更多操作问题,而不仅仅是导航和语言理解。
公司还在引入多机器人协作。报道称,Gemini Robotics ER 2 是一款以视觉-语言模型智能体形式构建的具身推理模型,旨在帮助机器人与人沟通、理解物理世界并规划持续数分钟的多步骤任务。DeepMind 将这一推理层定位为机器人团队协同完成工作的基础,而不是彼此孤立运行的机器。
这一点在战略上很重要。在工业自动化中,机器人系统的价值往往取决于多个机器和工作流之间的协调。如果 AI 模型能够协调机器人之间的交接或分工,部署经济性可能会向更灵活的自动化方向转变。
设备端运行可能扩大部署范围
另一个值得注意的元素是本地执行。The Robot Report 说,Gemini Robotics 2 可以在设备端运行,并在几小时内适配全新的机器人本体。DeepMind 还单独推出了 Gemini Robotics On-Device 2,称其针对本地机器人硬件进行了优化,并可以用少量数据在数小时内适应新的具身形态。
这一说法回应了机器人部署中的两个现实限制。首先,依赖云端会带来延迟、可靠性和运维复杂性问题。其次,机器人开发者不希望为每个平台都从头重新训练系统。一个能快速迁移到不同具身形态的模型,会对硬件厂商和希望缩短集成周期的企业客户更有吸引力。
不过,可用性仍然有限。The Robot Report 说,Gemini Robotics ER 2 已在 Google AI Studio 提供,并在 Gemini Enterprise Agent Platform 上进入私人预览;而 VLA 和设备端模型则向早期访问合作伙伴提供。这意味着这次发布仍更接近受控推出,而不是广泛产品发布。
这次发布对物理 AI 的信号
更广泛的信息是,大型 AI 公司正在更积极地进入物理系统,而不仅仅是数字助手。DeepMind 的表述显示,它认为机器人是下一个必须证明多模态模型能够把理解转化为行动的领域。语言、视觉和规划很有用,但在机器人领域,只有当它们能在复杂真实空间中产生可靠运动时,才真正重要。
Gemini Robotics 2 并没有解决人形机器人是否会成为最终胜出形态的问题,也没有证明基于基础模型的控制已经解决了可靠性难题。但它确实表明了这个领域的方向:朝着能够跨不同机器人本体泛化、在本地执行、同时使用移动与灵巧操作,并在多步骤任务中与其他机器人协作的模型前进。
为什么这很重要
- 这次发布把 AI 控制从桌面操作扩展到了全身机器人运动。
- DeepMind 将行走能力与灵巧手部控制结合起来,这是实际工作的重要前提。
- 设备端运行和更快适配可能降低新硬件的集成门槛。
- 多机器人协作指向的是更广泛的自动化系统,而不是单一用途机器。
眼下的检验将是,早期访问合作伙伴能否在展示场景之外复现这些能力。如果可以,Gemini Robotics 2 可能会成为从多模态 AI 演示迈向更强物理自动化的一个重要标志。
本文基于 The Robot Report 的报道。阅读原文。
Originally published on therobotreport.com



