机器人使用智能体:通用模型如何改写机器人控制
这期 YC Paper Club 并未宣称机器人问题已经解决,而是在梳理一种正在成形的范式:把机器人看作通用模型可以使用的外部工具系统。Hamid、Vincent 和 Jay 结合 Waddle Labs 的机器人 LLM harness 与 RoboCurve 的物理 AI 评测经验,讨论 RT-2、code as policies、上下文学习、技能压缩、计算机使用数据与空间智能之间的关系。文章的核心判断是:机器人能力可能越来越依赖通用模型在代码、视觉、工具调用和多模态表征上的能力,但延迟、经济性、失败检测、技能管理和经验压缩,仍会决定这条路线能否从演示走向可靠部署。
一、嘉宾背景
本期节目来自 Y Combinator Podcast / YC Paper Club,题目是《Robot-Use Agents: Why General-Purpose Models May Win in Robotics》,由 Y Combinator 于 2026-09-26 上传,长度约 29 分 49 秒。主持人把讨论放在一个清晰问题上:过去几年,coding agents 的跨领域泛化已经足够令人意外;现在,前沿研究者开始展示类似能力也可能进入机器人控制。Philip Isola 关于 robot-use agents 的文章成为本期思想入口:如果通用模型可以像使用电脑一样使用机器人,那么不同形态的机器人可能被同一类基础能力带动。
嘉宾是 Hamid、Vincent 和 Jay。Hamid 与 Vincent 来自 Waddle Labs;Jay 是 RoboCurve 的 co-founder。Waddle Labs 的工作重点是构建能够控制机器人的 LLM:他们搭建 harness,让模型更有效地接入机器人;收集交互数据;再用这些数据训练更好的 LLM。RoboCurve 则被 Jay 描述为 physical AI 的评测公司,测量不同机器人与不同模型路线,包括 LLM、传统方法、VLA、world action model,以及手、夹爪、机械臂、人形机器人、四足机器人等 embodiment。
这种嘉宾组合决定了节目的视角:它既不是单纯复述论文,也不是只看产品 demo 的创业访谈。Waddle 关心怎样让 LLM 真正控制机器人,以及怎样把一次探索沉淀为可复用技能;RoboCurve 关心能力如何被评价,不同本体和模型路线如何比较。主持人还提到,两组团队近期传播较广的视频展示了 LLM 让机器人拧开瓶盖、多机器人通信、打开笔帽等能力。这些例子在节目中不是最终证明,而是一个信号:机器人控制正在从专用动作模型,转向由通用模型、工具调用和代码策略共同组成的系统问题。
二、本期主要内容
节目首先回到 RT-2。Jay 将 RT-2 描述为较早把 AI 成功用于机器人控制的路线之一:它使用在网页文本和图像上预训练的语言模型,再微调为控制机器人。关键变化是,模型不再输出英语,而是输出 end effector pose,也就是可以转译成关节命令的末端执行器坐标与姿态。这个例子对本期论证很关键,因为它说明机器人动作能力并不只来自机器人数据;网页图像和文本中的世界知识也能提升 VLA 表现,相比完全不借助这类预训练、只训练机器人基础模型更有优势。
RT-2 同时被用来说明旧范式的限制。Francois 将 VLA 的直接动作输出类比为早期语言模型做数学题时只能直接给答案:模型必须马上给出动作或答案,很难按任务复杂度动态分配更多推理计算。链式思考让语言模型先推理再作答,而今天的机器人 LLM 系统则可以先看图像、调用工具、写代码、探索环境,再把行动交给机器人。问题不只是模型架构不同,而是控制流程从“一次性映射”转向“思考、编程、调用工具、执行、观察”的循环。
随后节目进入 code as policies。主持人把它放在 2022 年末的研究背景中:那时 coding agents 还没有今天成熟,但相关论文已经让模型写机器人策略。Jay 解释,早期 code-as-policies 工作会给 coding agent 一组库函数,例如 pick up an object、lift up、move to certain pose,然后让模型写 Python 代码组合这些函数,控制机器人完成复杂任务。令人惊讶的是,这类系统可以 one-shot 地使用这些函数,不需要额外大量机器人数据,因为模型已经从代码数据中学会顺序、循环、条件和工具组合。节目由此把 code as policies 视为连接 coding agents 与机器人控制的桥梁。
中段讨论转向学习形式。Francois 把 in-context learning 描述为把 state-action-result 或 state-action-reward 样本追加回 policy 的上下文。它成本低,不需要 SGD,也不需要训练 FLOPs;在低数据场景中可以快速带来改进。但他强调,这种改进并不稳定:实验中的提升是非单调的,会变好也会变差,并在大约 20 到 40 个例子后饱和;超过模型实际可用的上下文长度后,继续塞入信息不仅不会改进,还可能因为模型无法关注全部内容而变差。因此,节目把 RAG、LoRA、完整 SFT/RL,以及把经验压缩为工具和技能,放在比单纯 ICL 更长期的学习层级中。
Waddle 的 harness 正是在这个层级里被解释。嘉宾将 harness 看成一种 domain specificity:机器人进入新环境时,第一次可以让大模型在上下文中学习和试错,但未来 agent 不应反复承受同样的高延迟。学到的动作、记忆和技能可以被写成程序、技能库,或更小模型可执行的组件。大模型负责做领域专用化,小模型或程序在 harness 内更快地执行任务。这一点在 demo 讨论中变得具体:Astra 可以读取相机输入,通过工具调用控制机械臂,把桌上的积木放进碗里;但如果任务重复,让 Astra 每一步都在线思考就会很慢。
节目后段把这种工程路径提升到表示学习层面。主持人介绍 Philip Isola 的 Platonic representation hypothesis:随着数据规模扩大,不同模态、不同训练目标下的系统可能收敛到某种一致的世界映射。Jay 将它落到机器人争论上:如果强语言模型与强机器人模型学到类似世界表征,那么足够强的语言模型也可能成为足够强的机器人模型。这并未被当作已经证明的事实,而是成为本期判断通用模型路线的理论支点。Jay 还推测,Astra 的空间智能进步可能来自强视觉能力,以及更多 computer-use 与 CAD 数据;在 Blender 中旋转 CAD 物体、拖动光标改变视角这样的数据,可能教会模型上下、左右、空间和对象关系。
三、核心观点:推理、例子与边界
本期最重要的判断是:机器人控制可能越来越接近“让通用模型使用机器人”,而不是只训练一个依赖机器人数据的专用模型。这个判断来自几条相互支撑的证据链。RT-2 显示,web text 与 web image 预训练可以提升 VLA 表现;code as policies 显示,LLM 从代码数据中学到的程序组织能力可以迁移到机器人函数调用;现代模型在工具使用、代码生成和 in-context exploration 上的能力,则让控制过程不再只是输入图像和语言、直接输出动作的端到端映射。
这里的重点不是否定 VLA,而是指出直接动作输出的瓶颈。Francois 用数学题作类比:如果模型面对简单任务和复杂任务时都只能立即吐出一个动作或答案,它就很难为更复杂的场景分配更多计算。代码策略改变了这一点。模型可以先生成一个策略程序,让程序在不同状态下映射到动作;也可以把工具调用和感知模块放进循环,让确定性流程处理重复步骤,让 VLM 或 LLM 处理检测、失败判断和异常分支。Waddle 在 demo 讨论中强调,靠近瓶子、抓取、移动这类重复步骤可以逐渐变成 deterministic policy graph,而对象检测或失败恢复才需要更灵活的模型判断。
节目中的例子也说明,所谓“通用数据”并不空泛。CAD、Blender、GUI 操作、第一视角视频、计算机使用数据,都可能携带与物理世界相关的空间结构。Jay 对 Astra 的解释带有推测性质:它的空间智能进步可能来自更强的视觉能力,以及更多 computer-use 和 CAD 预训练。这个推测的价值在于扩展了数据边界:机器人数据不再只等于遥操作轨迹,模型也可能从人类为理解物理世界而发明的数字界面中学习空间关系。
这些观点也有明确边界。节目没有把标题里的“通用模型可能赢”处理成已经被量化证明的结论,而是在讨论一种从 demo、论文和创业实践中浮现的技术路线。Jay 关于两年内甚至更早出现 general-purpose robots 的说法,也只是他描述前沿实验室和机器人基础模型公司中“有人相信”的判断;其定义被限定为能按照自然语言指令,完成有能力青少年徒手能做的事情,并泛化到未见任务和环境,而不是无限能力的科幻机器人。
harness 路线本身同样暴露出未解决问题。直接让 Astra 每一步都思考会带来延迟,经济上不可用;ICL 在低数据阶段很强,但改进非单调、很快饱和,并受可用上下文长度和注意能力限制。长期系统还必须解决技能如何压缩、剪枝、组织和检索。节目用 sleep-like compression、DAgger 和 DreamCoder 类比这个问题:白天收集经验,离线反思和重构,把轨迹、技能或库压缩为更紧凑的表示。类比很有启发,但也说明节目并未给出一个已经被证明的统一答案。
四、学习与应用
如果把本期内容转化为机器人团队的产品和研发提示,第一条是重新审视系统边界。团队不应只问“要训练什么机器人模型”,还要问“模型要通过什么 harness 使用机器人”。一个实用系统可能需要相机输入、机器人 API、技能库、失败检测、记忆、检索和策略压缩机制。通用 LLM 可以承担探索、规划、写代码和异常判断,但重复、低延迟、高吞吐的步骤,应尽量被编译成代码、技能或更小模型来执行。
第二条是分清不同任务需要的学习方式。新环境、新器具、新流程刚出现时,in-context learning 很有价值:它便宜、快速,适合把少量 state-action-result 或 state-action-reward 样本直接放进上下文,让系统迅速调整。但它不应被误认为持久学习。样本变多后,检索、技能库、LoRA、SFT/RL 或离线压缩可能更合适。对企业部署而言,这意味着日志和交互轨迹不能只是调试材料,而应被设计成未来可检索、可蒸馏、可重构、可训练的数据资产。
第三条是把 code as policies 当成工程抽象,而不是论文标签。团队可以把 pick、move、detect、retry、verify 等底层能力整理成清晰 API,让大模型负责组合策略。策略图中稳定的部分用确定性代码运行,变化点才调用 VLM 或 LLM。这样做会让系统更接近软件工程:接口设计、工具权限、错误处理、可观测性和版本管理会变得与模型能力同等重要;相应地,延迟、可复用性和边界控制也更容易管理。
第四条是扩大数据想象力,同时守住证据边界。节目给出的线索是,计算机使用、CAD、Blender、GUI 和第一视角视频可能帮助模型学习空间概念;这鼓励机器人团队不要只盯着昂贵的遥操作数据。但它并不意味着任意非机器人数据都会自动转化为可部署的控制能力。真正判断数据是否有用,仍需要像 RoboCurve 关注的那样,在不同模型、不同机器人本体、不同任务和不同失败模式上做评测。
最后,面向战略判断,本期提醒人们把“通用机器人是否临近”拆成更可操作的问题。自然语言指令泛化、未见环境适应、失败检测、动作延迟、单位经济性、技能库增长后的管理,都是比宏大口号更具体的检查项。如果两年内出现接近 ChatGPT moment 的机器人能力,它也不会只来自一个更大的动作模型,而很可能来自强视觉模型、代码策略、工具调用、harness、检索、技能压缩和评测体系的组合。边界同样清楚:在这些环节被可靠解决之前,精彩 demo 还不能直接等同于稳定、经济、可规模化的机器人产品。
来源
More from WayDigital
Continue through other published articles from the same publisher.
Comments
0 public responses
All visitors can read comments. Sign in to join the discussion.
Log in to comment