具身智能之通用机器人RoboCat详解:一个能用少量示范快速学会新任务和新机器人的自我改进智能体
写在前面
【从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。
项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git
AIGC算法岗/开发岗面试面经交流社群(涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源)欢迎大家加入:https://t.zsxq.com/YtJ09
RoboCat详解:一个能用少量示范快速学会新任务和新机器人的自我改进智能体
导读
传统机器人学习通常为每个任务单独训练策略,换一台机器人、换一组物体,往往又要重新采集数据。RoboCat 把问题改写成一个多任务、多本体的序列建模问题:它接收视觉观测、本体状态和一张表示目标任务的图像,输出当前机器人需要执行的动作 token。训练数据可以来自不同自由度、不同观测和动作规格、不同控制频率的模拟与真实机械臂。
RoboCat 的核心不只是一只“通用策略”,而是一条自我改进循环。先用多任务数据训练 generalist,再用 100–1000 条人工遥操作示范把它微调到新任务;微调后的策略部署到真实机器人上自主采集更多轨迹,经过 hindsight goal relabeling 后加入下一轮训练集。新任务因此从“人工示范”变成“示范引导的自动数据扩增”。
论文在模拟环境和 36 台真实机器人上评估了这一思路,覆盖 Sawyer、Panda 和训练时未见的 KUKA 14-DoF 机械臂。RoboCat 能适配未见物体、未见任务族、sim-to-real 场景和全新本体;在真实 KUKA 上,零样本成功率为 0%,使用少量示范微调后可以达到约 69%–80% 的成功率区间。论文真正要验证的是:通用策略的价值不仅在于一次性解决更多任务,还在于降低下一项技能的获取成本。

图 1:RoboCat 从多任务训练集开始,微调到新任务后自主生成更多数据,再将数据回流训练下一代 generalist。来源:论文 Figure 1。
猫先生认为,RoboCat 的关键贡献是把“策略学习”和“数据生产”接在了一起。模型不是训练完成就结束,而是成为下一轮数据采集的工具;这比单纯把模型做大更接近机器人基础模型真正需要的增长路径。
- 论文标题:RoboCat: A Self-Improving Generalist Agent for Robotic Manipulation
- 论文地址:https://arxiv.org/abs/2306.11706
- 论文 PDF:https://arxiv.org/pdf/2306.11706
- 论文版本:arXiv v2,2023-12-22
- 发表信息:Transactions on Machine Learning Research,2023
原文脉络
Introduction 说明异构机器人数据难以规模化利用;Section 2 定义 RoboCat 的视觉目标条件策略、token 化方式和自我改进循环;Section 3 介绍模拟/真实本体、物体集、任务族和数据来源;Section 4 说明训练与评测协议;Section 5 依次验证训练任务能力、少样本泛化与适配、自我生成数据的收益;最后讨论语言条件、强化学习和更开放环境等后续问题。
1. Introduction:从单任务策略走向可持续扩展的通用智能体
机器人数据的困难不只是规模小,还在于数据之间差异很大:相机视角不同,动作维度不同,机械臂自由度不同,控制频率也不同。RoboCat 不要求这些数据先被严格映射到同一个动作空间,而是依靠 Transformer 对可变长度 token 序列的处理能力,将本体差异编码在上下文中。
任务使用视觉目标条件来描述。给定一张表示“完成状态”的目标图像,模型需要根据当前观测决定动作。目标图像不是要求机器人逐像素复现某个状态,而是告诉它应该完成哪类任务,例如“把苹果放进碗里”。一条轨迹末尾的图像天然可以作为 hindsight goal,因此失败或次优轨迹也能被重新利用,不需要额外为每个时间步标注任务。
2. RoboCat:视觉目标条件的自回归决策 Transformer
2.1 输入、输出与任务定义
模型策略写成:
π ( a t ∣ o t , g t ) = P θ ( a t ∣ x < t , I < t , g < t ) \pi(a_t\mid o_t,g_t)=P_\theta(a_t\mid x_{<t},I_{<t},g_{<t}) π(at∣ot,gt)=Pθ(at∣x<t,I<t,g<t)
其中 x t x_t xt 是本体状态, I t I_t It 是当前图像, g t g_t gt 是固定的目标图像, a t a_t at 是动作。由于不同机器人需要的本体状态和动作维度不同,序列中的 token 数量 L L L、 Q Q Q 可以随本体变化。模型不依赖一个强行统一的固定动作向量,而是从当前上下文推断应该输出多少动作 token。
2.2 VQ-GAN 图像 token 与辅助未来预测
RoboCat 沿用 Gato 的自回归 Transformer 架构,但图像使用预训练且冻结的 VQ-GAN 编码器离散化。每张图像被编码成 8 × 8 8\times8 8×8 网格的视觉 token,编码器预训练数据混合了 ImageNet、Atari、MuJoCo 和机器人操作图像。冻结编码器并提前完成 token 化,降低了大规模训练和迭代成本。
模型除了预测动作,还预测未来第 k = 5 k=5 k=5 个时间步的图像 token。相邻帧通常高度相似,直接预测下一帧提供的信息有限;预测更远的视觉状态迫使表示保留物体运动和任务进展。训练目标可以写成动作 token 与未来图像 token 的联合对数似然:
L = E τ ^ [ ∑ t , q log P θ ( a t q ∣ history ) + ∑ t , m log P θ ( I t + k m ∣ history ) ] \mathcal{L}=\mathbb{E}_{\hat\tau}\left[\sum_{t,q}\log P_\theta(a_t^q\mid\text{history})+\sum_{t,m}\log P_\theta(I_{t+k}^m\mid\text{history})\right] L=Eτ^[t,q∑logPθ(atq∣history)+t,m∑logPθ(It+km∣history)]
论文主实验使用约 1.18B 参数、24 层的 decoder-only Transformer,另用 364M 版本进行部分消融。训练时实际使用 1024 个 token 的上下文,约覆盖 3 个时间步历史。

图 2:模型在 Sawyer 7-DoF、Panda 7-DoF、真实 Sawyer 5-DoF、真实 Panda 7-DoF 以及训练时未见的 KUKA 14-DoF 上运行。来源:论文 Figure 2。
猫先生认为,RoboCat 的“统一”不是把所有机器人改造成同一台机器人,而是把观测、目标和动作都变成序列上下文的一部分。这样做保留了本体差异的表达能力,但也把泛化压力交给了模型容量和训练数据覆盖。
2.3 微调与自我改进
对新任务 y y y,作者先收集 100–1000 条遥操作示范,初始化自通用模型的权重进行行为克隆微调:
θ f t y = arg max θ L ( θ ; D d e m o y ) \theta^y_{\mathrm{ft}}=\arg\max_\theta\mathcal{L}(\theta;\mathcal{D}^y_{\mathrm{demo}}) θfty=argθmaxL(θ;Ddemoy)
微调模型可以成为专用策略,但可能损失原任务能力。于是作者将其部署到真实机器人,自动采集新任务轨迹,并用成功检测器做 hindsight goal relabeling。下一轮数据集为:
D n e x t = D ∪ ⋃ y ∈ Y ( D d e m o y ∪ D i m p y ) \mathcal{D}_{\mathrm{next}}=\mathcal{D}\cup\bigcup_{y\in\mathcal{Y}}(\mathcal{D}^y_{\mathrm{demo}}\cup\mathcal{D}^y_{\mathrm{imp}}) Dnext=D∪y∈Y⋃(Ddemoy∪Dimpy)
其中 D i m p y \mathcal{D}^y_{\mathrm{imp}} Dimpy 是微调策略自主生成的数据。训练下一代 RoboCat 后,新的 generalist 再被用于更多任务,形成“预训练—微调—自主采集—再训练”的循环。
真实数据采集还有两个工程难点。第一,作者训练视觉 reward model 判断任务是否完成,以便 relabeling 和触发 reset;第二,使用 policy pool,把一个任务的终止状态作为另一个任务的起始状态,通过多个策略的组合自动重置环境,减少人工复位。
3. Tasks and Data:从结构搭建到精细插入
RoboCat 的训练任务包含 240 个任务,另有 13 个专门用于微调的任务,总计 253 个任务。数据覆盖 2 种模拟本体和 3 种真实本体,包含 5 类模拟任务族、11 类真实任务族,以及 123 个模拟物体和 134 个真实物体。
物体和任务设计覆盖堆叠、精细插入、日常水果蔬菜、形状匹配等场景;任务变体同时改变本体、任务族、物体集和感知外观,用于测量物体泛化、行为泛化、sim-to-real 和本体泛化。
真实部署使用 36 台机器人:15 台 Panda、17 台 Sawyer 和 4 台 KUKA。KUKA 采用 14-DoF 机械臂和三指手,并且在通用模型训练阶段未出现,只在微调阶段加入。这使 KUKA 成为检验“少量示范能否接入新本体”的关键测试。
4. Experimental Setup:通用模型与单任务视觉基线的对比
作者将 RoboCat 与单任务视觉基础模型进行比较。后者包括 CLIP 预训练的 NFNet-f6 和 Swin-L,每个任务单独训练,并使用与 RoboCat 相同的成功数据和行为克隆损失。另有 Gato 与 BC-IMP 作为部分堆叠任务的对照。
评测区分 generalist 训练任务和通用训练中不可见的 fine-tuning 任务,后者只使用 500 或 1000 条示范;作者定期检查 checkpoint,再用 100 个 episode 汇报最终结果。
5. Experiments:少样本适配和自我生成是否真的有效
5.1 多任务训练能力
在训练任务上,单个 1.18B RoboCat 可以同时处理模拟和真实环境中的多种堆叠、搭塔、金字塔、搬运、插入和移除任务。与单任务 VFM 相比,RoboCat 在绝大多数真实任务上更好;在模拟中,它在较难的塔构建和金字塔构建上优势更明显。364M 小模型在简单堆叠上接近大模型,但在难任务上明显下降,说明多任务 generalist 需要足够容量。

图 3:RoboCat 与单任务视觉基础模型在模拟、真实训练任务上的成功率对比。真实场景数据较少时,多任务联合训练带来的共享经验更明显。来源:论文 Figure 5。
5.2 泛化与少样本微调
作者训练了数据受限版本 RoboCat-lim,并显式留出任务变体、物体和本体。它可以在 0-shot 下泛化到部分未见变体;对于不能零样本解决的任务,100–500 条示范通常就能完成有效适配。
在真实 Sawyer 的 blue-on-green 堆叠上,500 条示范微调达到 88%,Gato 在同一数据上的成功率为 60%。对未见的真实 KUKA 14-DoF,本体差异更大:零样本成功率为 0%,加入少量示范后达到约 69%–80% 的成功率,说明模型需要通过微调重新学习新动作和观测接口,但不必从零开始学习所有视觉与操作规律。

图 4:随着示范数量从 0 增加到 100、500、1000,RoboCat-lim 能适配未见物体、任务变体、sim-to-real、任务族和新 KUKA 本体。来源:论文 Figure 7。
VFM 基线只看到某一任务的 1000 条数据,无法利用 RoboCat 在其他机器人和任务中学到的先验;因此在少样本新任务上普遍表现较差。这个对比说明微调效率来自通用模型已有的跨任务表征,而不只是来自更强的单任务网络。
5.3 Self-improvement:让模型自己制造下一轮数据
自我改进实验比较两种方案:只把少量新任务示范加入通用训练集,或者先微调策略、让策略自主生成更多成功和失败轨迹,再把这些数据一起加入。364M 小模型实验中,加入自生成数据的版本在四个任务上都超过只使用示范的版本。
在更大规模实验中,多个 RoboCat-lim 专家分别微调到水果搬运、堆叠、塔构建和插入/移除任务,随后自动采集数据训练新的 generalist。新 RoboCat 在许多数据生成任务上的表现接近甚至超过生成数据的专用策略,同时对更多下游任务拥有更好的泛化和微调能力。

图 5:比较只加入示范数据与同时加入策略自生成数据的结果;自生成数据使下一代 generalist 在多个任务上获得更高表现。来源:论文 Figure 9。
猫先生认为,自我改进循环最有价值的地方是把机器人数据采集从一次性成本变成了可复用资产。但它并没有消除人工监督:新任务仍需要初始遥操作示范、成功检测和安全的 reset 机制。它降低的是“从 100 条示范走向足够训练数据”的成本,而不是让机器人完全脱离人类定义任务。
6. Discussion:RoboCat 的能力边界
RoboCat 证明了三件事:大 Transformer 可以在多种真实本体上完成视觉操作;通用模型可以用 100–1000 条示范适配未见任务;微调策略还能提供下一轮训练数据。覆盖范围包括未见物体、任务族、sim-to-real 和 KUKA 本体。
但它仍不是开放世界机器人。任务主要是桌面物体操作,目标由图像指定,模型本身只使用行为克隆而非在线强化学习;不同机器人虽然动作和观测规格不同,却处于相对受控、视觉相似的实验环境。语言条件、多模态目标、开放场景和安全交互仍是后续工作。
总结:通用智能体的终点不是一次训练,而是更便宜的下一次学习
RoboCat 将视觉目标条件、可变长度序列建模、少样本微调和自主数据采集组合成一条自我改进路线。它的模型设计让不同本体可以在同一个 Transformer 中共存,hindsight goal 让轨迹更容易复用,policy pool 和 reward model 则把真实数据采集变成可持续工程流程。
猫先生认为,RoboCat 最值得记住的不是某个成功率,而是一个学习闭环:**通用模型用已有经验帮助新任务,新任务再用少量人工示范和自主数据反哺通用模型。**如果未来的机器人基础模型能够把这个闭环扩展到语言、长时程任务和开放环境,模型规模才会真正转化为持续增长的机器人能力。
参考资料
- Bousmalis et al., RoboCat arXiv 页面
- Google DeepMind / RoboCat,论文 PDF
推荐阅读
► 技术资讯: 魔方 AI 新视界
► 项目应用:开源视界
► 技术专栏: 多模态大模型最新技术解读专栏 | AI 视频最新技术解读专栏 | 大模型基础入门系列专栏 | 视频内容理解技术专栏 | 从零走向 AGI 系列
更多推荐




所有评论(0)