一个大脑,任意身体:Gemini Robotics 2 之后,通用机器人到底卡在哪里
这篇分析基于 The Cognitive Revolution 对 Google DeepMind Gemini Robotics 研究负责人 Kiruthina Gopalakrishnan 的长访谈。节目借 Gemini Robotics 2、Robot Olympics、跨具身迁移、VLA、HRI、数据路线与安全机制,拆解通用机器人从炫技演示走向真实部署所需跨过的关键门槛。
一、嘉宾背景
Kiruthina Gopalakrishnan 在这期节目中的身份不是泛泛评论者,而是 Google DeepMind 的 staff research scientist,并担任 Gemini Robotics 的 research lead。节目明确围绕 Gemini Robotics 2、Gemini Robotics ER2、Gemini Robotics On-Device 2、跨 embodiment 机器人模型、人形机器人与通用机器人研究展开。因此,她的发言价值主要来自一线研究视角:她既能解释模型架构,也能说明哪些演示看起来震撼,却不一定代表通用机器人能力已经成熟。
主持人 Nathan Labenz / Erik Torenberg 把讨论放在 The Cognitive Revolution 的典型问题框架里:AI 已经在数字世界产生影响,但如果机器人很快进入物理世界,时间线会怎样改变?Nathan 用 AI 2027 的激进预测作为参照,提出 2027 年中人形机器人变得有用、2028 年出现机器人经济这样的说法;但节目没有把这些数字当作已被验证的事实,而是把它们作为待检验的 episode framing。
这也解释了访谈的重心:它不是对 Gemini Robotics 2 发布信息的复述,而是一次关于“一个大脑能否适配任意身体”的研究盘点。Kiruthina 谈到的经验覆盖具身推理、VLA/action model、on-device 部署、humanoid intelligence、hands、whole-body control、HRI、安全与数据来源。她多次拒绝过度预测,强调机器人路线、世界模型、数据配比与部署节奏都需要实验结果支撑。
二、本期主要内容
节目开场从中国 Robot Olympics 的病毒式视频切入。Nathan 关心的是:如果人形机器人已经能在跑道上跑得很快,这是否意味着通用机器人接近实用?Kiruthina 的回答相当冷静。她承认这些视频抓住了公众想象力,也承认 locomotion 的进展明显,但她把这种进展放回技术结构中理解:平地跑步、墙面或地面的接触更容易建模,locomotion 可以大量依赖 simulation,因此视觉上震撼的跑步演示,并不等于机器人已经能在开放世界稳定完成有用任务。
随后,访谈进入 Gemini Robotics 2 的三层结构。ER2 被描述为偏 system 2 brain 的具身推理模型,基于 Flash 系列,面向机器人任务调优,可做图像、视频、语义理解和具身推理;Gemini Robotics 是 VLA/action model,把用户或高层模型的意图转化为机器人动作;on-device 版本则是更小、更适合放进机器人本地计算机的动作模型。这个架构让讨论从“机器人有没有一个聪明大脑”转向“高层推理、动作模型、低层控制器和硬件如何协作”。
中段讨论围绕速度、可靠性和泛化展开。Nathan 提到自己用 API 做实验时,从“move the banana to the plate”到 tool call 有时约 6 秒,因此担心真实世界响应速度。Kiruthina 没有把这个问题简单归结为快或慢,而是区分应用场景:装配线不能慢,家庭折衣服也许更看重完成质量。她还说,大模型可能先出现前沿能力,再通过不同规模版本、云端版本和 on-device 版本服务不同场景。
后半段,话题扩展到跨 embodiment、手部硬件、HRI、安全、世界模型、训练数据和多机器人交互。Kiruthina 认为,机器人仍更像 GPT-2 阶段,因为 few-shot learning 尚未在大量任务上可靠工作,而且同一个“大脑”迁移到不同机器人身体仍然很难。她也解释了为什么 humanoid 不只是外形选择:它会暴露 HRI、whole-body control、多指 dexterity 等完整研究前沿。节目最后落在更长期的问题上:机器人是否需要 forward-looking simulation 或 world modeling?数据是否会由 egocentric video 主导?Kiruthina 的立场仍是开放而经验主义的。
三、核心观点:推理、例子与边界
这期访谈最有价值的判断,是把那些“看起来已经抵达未来”的机器人演示拆回不同能力层。跑得快的人形机器人可以代表 locomotion 研究的最新进展,但 Kiruthina 明确指出,脚速通常不是实用机器人的核心瓶颈。原因在于 locomotion 所面对的物理世界相对容易建模:平地、墙面、刚性接触、规则赛道,都让从仿真训练迁移到真实环境更可行。真正暴露机器人难度的,往往是 manipulation:布料会变形,垃圾袋会塌陷,蛋会掉到地上,薯片会被压碎,手指与物体之间的摩擦、力、接触顺序,很难在仿真中完整穷尽。
她对 Robot Olympics 的判断也体现了这种谨慎。她没有把跑步视频视为通用智能的证据,而是先说明自己没有参与那些演示,只能推测它们可能使用了 motion imitation、RL 控制器,以及针对特定机器人身体和高速跑步任务的调校。这里的关键在于:一个系统在一个身体、一个任务、一个赛道上表现出色,并不自动说明它具备可迁移到家庭、工厂、厨房或医院的通用机器人能力。
Gemini Robotics 2 的意义,在于它尝试把机器人系统拆成“高层脑、动作脑、低层控制”的协作结构,而不是把能力归结为一个神秘的端到端黑箱。ER2 负责具身推理、工具调用、inspection、instrument reading、pointing 等机器人相关理解;VLA/action model 将意图转化为动作;低层系统仍要处理稳定、目标达成和硬件约束。Kiruthina 解释 whole-body control 时,也没有说高层 VLM 会以高频率直接解决全部稳定问题,而是说 VLA 控制从 fingertips 到 feet 的整体身体,同时更低层系统继续负责 stabilization 和 target achievement。
这引出第二个核心观点:机器人失败常常发生在系统编排处,而不只是因为“脑不够聪明”或“手不够灵巧”。ER 和 VLA 之间存在延迟、任务切换时机、完成判断,以及多步骤任务中的错误复合。一个十步任务里,高层推理和低层动作只要各自有失败概率,最终成功率就会被序列过程放大地拖低。Nathan 提醒,LLM 在电脑上 50% 成功也许还能人工补救,但机器人掉东西会损坏物体;Kiruthina 进一步区分了乐高这种可回退任务和煎蛋这种低容错任务。后者一旦蛋掉到地上、过火或造成混乱,就不能像文本编辑那样轻松 undo。
第三个核心观点,是泛化与 mastery 之间的张力。Kiruthina 承认,窄任务系统今天可以针对一两个任务优化得很好;但如果每增加第 n 个任务都近似于重新做一次,那么这不是通用机器人的路线。她看重 foundation model,是因为一个通用 baseline 可能降低后续把每个任务推向 mastery 的成本。这并不意味着通用模型已经足够可靠。恰恰相反,她把当前机器人类比为 GPT-2,而不是 GPT-3,因为 few-shot learning 还没有在大量任务上可靠工作。
具身 in-context learning 的不确定性尤其明显。看一次视频、照着完成一次任务,可以被理解为 video prompting;但关键问题是,模型到底是在复制演示,还是理解了任务并能适应新场景。Kiruthina 用“看一次绑垃圾袋后能否绑垃圾袋”作为更难的例子,因为这类任务涉及多指手、软物体、复杂接触和目标状态判断。这里的限制不是外部推断,而是她反复强调的研究边界:ICL 结果仍处在早期,必须区分记忆或模仿与真正泛化。
跨 embodiment 是机器人不同于纯数字 LLM 的根本难题。GPT 在手机、Mac、Linux 上的行为大体相近;机器人模型则会被身体形态、关节结构、手、传感器、稳定系统和运动范围改变。Kiruthina 说,如果一个模型只在你的机器人和你的设置上有效,就很难称为 generic brain。DeepMind 与 Apptronik、Agility Robots、Boston Dynamics 等伙伴合作,正是为了在不同身体上研究 VLA 和 humanoid intelligence。她同时给出积极信号和限制:trusted tester 中,少量样本,例如 200 examples,可以在许多不同身体上学习很多任务;但在新 embodiment 上以高可靠性零样本完成大量任务,仍缺少强先例。
人形机器人在节目中也没有被当作营销外壳。Kiruthina 的观点是,humanoid 会暴露非 humanoid 方案触及不到的研究问题,包括 HRI、whole-body control 和多指 dexterity。Gemini Robotics 2 中自然手势、机器人接受采访并评价自己任务表现等例子,说明 HRI 已经成为模型和系统的一部分,而不是给视频添加几个预编程点头。但她也指出限制:类人外观和对话会让新用户产生社会投射,边界因此变得模糊;同样的失误,如果发生在 gripper robot 上,人们可能更宽容,发生在人形机器人上则会被更严厉地评判。
安全因此不是能力之外的附加项,而是能力本身。Kiruthina 明确说,人们不会使用不安全的机器人或 agent。安全既包括不违法、不制造混乱,也包括 operational safety:摔倒、稳定性、传感器遮挡、力控失误、e-stop 方式、机械设计和系统安全。她用“篮子盖住机器人头”的例子说明,机器人在视觉被遮挡时不应继续盲目执行任务,而应识别 obstruction 并请求移除。这类例子把安全从抽象 alignment 拉回物理世界:强机器人不仅要知道目标,还要知道何时停下、何时求助、何时降低动作权限。
节目对未来路线也保持不确定性。Nathan 引用 Jim Fan 关于 forward-looking simulation 或 world modeling 的观点,认为机器人也许不能只看当前状态、推理、行动、循环,而需要预测未来,并比较预期与现实之间的差异。Kiruthina 没有否定这个方向,但也没有把它视为唯一答案。她把 VLA、VAM、agent robotics、world modeling 都放在开放研究集合里,强调 roboticist 应该执着于问题,而不是执着于方法。这一限制也界定了访谈的结论:Gemini Robotics 2 并不等于通用机器人已经被解决;真正的前沿,正在从单点任务演示转向跨身体、跨场景、跨系统编排的综合能力。
四、学习与应用
第一种应用,是评估机器人新闻和演示时,不要只问“它看起来多像人”,而要拆成 locomotion、manipulation、dexterity、HRI、编排、安全和跨 embodiment。跑步、后空翻、快速移动可以展示控制能力,但如果任务发生在平地、刚体和可建模接触中,它对开放世界实用性的证明力有限。更有诊断价值的测试,是能否处理软物体、脆弱物体、遮挡、任务中断、变化场景和低容错后果。
第二种应用,是为机器人产品或研究项目选择任务时,把“失败成本”和“可重试性”放在中心。乐高装配、物品分拣、某些 pick-and-place,即使失败也可能回退修复;煎蛋、倒热液体、抱小孩、在拥挤家庭里移动,则容错空间更小。一个任务是否适合早期部署,不只取决于模型平均成功率,还取决于失败后能否检测、撤销、补救,以及失败是否会造成物理损害。
第三种应用,是把机器人能力当成系统能力来设计。ER、VLA、低层控制器、传感器、手、云端或本地模型、工具接口、任务状态记忆,都会影响结果。API 开发者不能只写一个自然语言 tool description,就期待模型适配所有机器人;Kiruthina 提醒,机器人 API 没有统一标准,常见 API 也许更友好,陌生 API 需要测试。实际系统应保留日志、完成判断、异常检测、重试策略和人工接管路径。
第四种应用,是理解速度不是孤立的优化目标。装配线、协作机械臂或高速分拣需要低延迟;家庭折衣服、夜间整理、离线 inspection 可能更能接受慢模型,以换取更高质量的推理。产品设计应把模型规模、云端连接、on-device 能力和任务时限一起考虑。大模型可承担规划、复杂语义理解或离线分析,小模型或本地模型可承担实时动作、常见任务和断网场景。
第五种应用,是不要把 one-shot 演示误读为可部署的泛化能力。视频提示和 in-context learning 很有前景,但评估时应主动改变场景、物体、初始位置、照明、干扰和目标顺序,看机器人是否理解任务结构。若模型只会复制演示,它适合窄场景自动化;若能在变化后保持目标和约束,才更接近通用机器人能力。垃圾袋、布料、易碎品和多步骤厨房任务,比简单 pick-and-place 更能测试这一点。
第六种应用,是把跨 embodiment 当作路线选择的硬指标。若目标是“一个大脑,任意身体”,训练和测试就不能只围绕一台机器人。可以采用 foundation model 加少量 embodiment-specific examples 的现实路径,但应明确说明样本数量、任务范围、可靠性水平和未测试身体。200 examples 在访谈中是一个说明性经验,不应被包装成普适定律。
第七种应用,是让安全进入产品需求,而不是成为发布前补丁。机器人应能识别传感器遮挡、力异常、无法稳定、任务语义不清、用户指令越界和旁人干扰。hard e-stop 与 soft e-stop 的选择也要结合身体形态:断电可能让机器人坍塌,冻结在某些双足平台上更安全。越 agentic 的机器人系统,越需要低层访问、可解释状态、可中断控制和细粒度反馈。
第八种应用,是数据策略不要押注单一路线。teleop 精确但昂贵,且会随着硬件变化衰减;UMI 通过传感器提供较好的动作标签,但仍受硬件规模限制;人类第一视角视频规模大、语义丰富,但 end-effector 信号噪声高。务实路线通常会混合使用这些数据,并随着手部硬件、触觉传感、仿真质量和 on-device 模型的变化重新配比。
最后,面向 humanoid 的产品和研究需要额外处理社会边界。自然手势、对话和类人外观会提升可用性,也会提高用户期待与误解风险。合适的设计不是让机器人假装完全像人,而是让它在能做什么、正在做什么、何时不确定、何时需要人类介入这些方面足够清楚。通用机器人真正进入日常生活,不会只靠一个更强模型,而要靠任务选择、系统编排、硬件可靠性、安全机制和人机界面共同成熟。
来源
More from WayDigital
Continue through other published articles from the same publisher.
Comments
0 public responses
All visitors can read comments. Sign in to join the discussion.
Log in to comment