具身智能低成本操作之ALOHA详解:低成本双臂硬件如何学会精细操作
写在前面
【从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。
项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git
AIGC算法岗/开发岗面试面经交流社群(涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源)欢迎大家加入:https://t.zsxq.com/YtJ09
ALOHA详解:低成本双臂硬件如何学会精细操作
导读
精细操作不是把“抓取”做得更快,而是要求机器人在接触、摩擦、遮挡和物体形变同时存在时持续修正动作。拧开半透明调味杯、把电池插入槽位、穿过扎带,这些任务对视觉闭环和双臂协调的要求很高,传统方案往往依赖昂贵机械臂、精密传感器和复杂标定。
《Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware》提出 ALOHA(A Low-cost Open-source Hardware System for Bimanual Teleoperation),用两台低成本 WidowX 作为 leader、两台 ViperX 作为 follower,配合 3D 打印手指、handle-and-scissor 机构和四路普通 RGB 摄像头,在约 2 万美元预算内完成双臂遥操作和数据采集。更重要的是,论文提出 ACT(Action Chunking with Transformers):策略不再每次只预测一个动作,而是预测未来一段动作块,并用 temporal ensemble 融合重叠预测。
论文用每个任务约 50 条示范、约 10 分钟数据训练 ACT,在 6 个真实任务上取得 20%–96% 的成功率;其中滑动自封袋 88%、插入电池 96%、打开杯盖 84%、穿魔术贴 20%、准备胶带 64%、穿鞋 92%。结果说明,低成本硬件的精度不足可以通过高频视觉闭环、合适的数据采集和动作序列建模部分弥补。

图 1:ALOHA 使用 leader-follower 双臂结构进行遥操作,覆盖精细、接触丰富和动态任务。来源:论文 Figure 1。
猫先生认为,ALOHA 的价值不只是“把机器人做便宜了”。它把硬件设计和模仿学习算法一起优化:硬件负责低延迟、可重复地采集双臂示范,ACT 负责把这些示范转成平滑、闭环的动作序列。低成本真正成立的前提,是数据采集和控制算法必须共同补偿硬件缺陷。
- 论文标题:Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware
- 论文地址:https://arxiv.org/abs/2304.13705
- 论文 PDF:https://arxiv.org/pdf/2304.13705
- 项目主页:https://tonyzhaozh.github.io/aloha/
- 论文版本:arXiv v1,2023-04-23
原文脉络
Introduction 先说明精细操作对视觉闭环和接触控制的要求;Related Work 将问题放在模仿学习、复合误差和双臂操作中。Section III 介绍 ALOHA 硬件,Section IV 推导 ACT 的 action chunking、temporal ensemble 和 CVAE,Section V 评估 6 个真实任务与 2 个仿真任务,Section VI 通过消融解释 chunk 长度、CVAE 和控制频率的作用,最后讨论硬件与任务边界。
1–2. 背景与相关工作:精细操作为什么需要新的数据与控制接口
行为克隆通常学习 π ( a t ∣ o t ) \pi(a_t\mid o_t) π(at∣ot),每个时间步根据观测预测一个动作。精细操作中,一次微小误差可能把物体推离可恢复区域,后续策略就会在训练分布之外继续犯错,这就是 compounding error。高频控制能增加反馈机会,却也让轨迹更长、示范中的停顿和速度变化更难建模。
ALOHA 采取 pixel-to-action 路线:四路 RGB 图像、双臂关节位置直接输入策略,输出两条机械臂的目标关节位置。作者不显式建模杯盖、胶带和电池的接触动力学,而是让策略从示范中学习“看到什么、怎样修正”。对于形变和接触复杂的对象,这比先建立完整物理模型更现实。
3. ALOHA:把低成本硬件做成可用的数据采集系统
3.1 Leader-follower 双臂和关节空间映射
Follower 使用两台 ViperX 6-DoF 机械臂,单臂约 5600 美元、负载 750g、精度约 5–8mm;leader 使用两台约 3300 美元的 WidowX。操作者直接回驱小型 leader,follower 在关节空间同步运动。相比 VR 控制器到末端位姿的 task-space 映射,关节空间映射不依赖实时逆运动学,靠近奇异位形时延迟更低,也更适合精细动作。
作者为 leader 增加 3D 打印 handle-and-scissor 机构,降低回驱阻力并提供连续夹爪控制;橡皮筋配重抵消部分重力,让操作者可以连续遥操作 30 分钟以上。follower 使用透明 3D 打印手指和抓握胶带,兼顾视野与薄膜物体的摩擦力。

图 2:前视、顶视和双腕相机共同覆盖双臂工作空间,handle-and-scissor 机构负责低成本连续控制。来源:论文 Figure 2。
系统使用四个 Logitech C922x 摄像头,分辨率 480×640,前方、顶部和两个手腕各一个;遥操作与记录频率为 50Hz。整套设备使用铝型材 cage 和可替换的 Dynamixel 电机,硬件、软件和 3D 打印部件均可由实验室自行维护,非专业人员约两小时可以完成搭建。
猫先生认为,ALOHA 的设计取舍很明确:它没有追求高端硬件把状态估计做“准”,而是用关节空间映射降低延迟,用腕部相机补足局部视觉,用高频闭环把误差留在可恢复范围内。可维修、可复现和可持续采集,比实验室里一次性调到极致更重要。
4. ACT:用动作块缩短有效决策视野
4.1 Action chunking 与 temporal ensemble
ACT 在时刻 t t t 不只预测一个动作,而是预测未来 k k k 步的目标关节位置:
π θ ( a t : t + k ∣ s t ) \pi_\theta(a_{t:t+k}\mid s_t) πθ(at:t+k∣st)
论文最终常用 k = 100 k=100 k=100。如果任务原本需要数百个高频控制步,动作块可以把有效决策次数降低约 k k k 倍;抓住糖果包装的一角、把电池送入槽位等局部动作,可以作为一个连续单元生成。
但每隔 100 步才重新观察会造成突变。ACT 因此在每个时间步重新查询策略,让不同时间产生的 action chunk 重叠;对同一未来时刻的多份预测做指数加权平均:
a t = ∑ i w i A t [ i ] ∑ i w i , w i = exp ( − m i ) a_t=\frac{\sum_i w_i A_t[i]}{\sum_i w_i},\qquad w_i=\exp(-m i) at=∑iwi∑iwiAt[i],wi=exp(−mi)
新观测对应的预测权重更高,旧预测逐渐衰减。这个 temporal ensemble 平滑的是“同一时刻的多份预测”,而不是把相邻时刻动作简单平均,因此不会明显引入滞后。
4.2 CVAE:让模型表达示范中的动作风格
同一观测可能对应多条合理示范,尤其是人类在非关键阶段会有停顿和速度差异。ACT 使用 conditional VAE:训练时 encoder 读取动作块和关节状态,压缩出 style latent z z z;decoder 读取四路图像、当前关节和 z z z,通过 Transformer 生成 k × 14 k\times14 k×14 的双臂动作块。部署时丢弃 encoder,把 z z z 设为先验均值 0,得到稳定的确定性输出。

图 3:ACT 的 CVAE encoder 在训练时提取动作块风格,decoder 融合多视角图像、关节位置和风格变量,预测未来动作序列。来源:论文 Figure 3 / 官方项目图。
ACT 的重建损失采用 L1;作者发现绝对目标关节位置优于关节增量,且 L1 比 L2 更适合高精度动作。模型约 8000 万参数,在单张 11GB RTX 2080 Ti 上每个任务从头训练约 5 小时,推理约 0.01 秒。
5. Experiments:十分钟示范能学会什么
5.1 真实任务与仿真任务
真实实验包含 6 个任务:滑动自封袋、插入电池、打开半透明杯盖、穿魔术贴、准备胶带、穿鞋。每个任务约 50 条示范,穿魔术贴使用 100 条;每条轨迹约 8–14 秒、400–700 步。仿真包含两个任务,并比较脚本数据和人类示范数据。

图 4:六个真实任务的初始化和关键子任务,覆盖薄膜、插入、撬盖、穿线与双臂协调。来源:论文 Figure 5。
ACT 在真实任务上的成功率分别为 88%、96%、84%、20%、64%、92%。穿魔术贴是明显难点,说明动作块与视觉闭环并不能自动解决高难度接触任务;但插入电池、开杯盖和穿鞋等任务在极少示范下已经达到较高成功率。
仿真结果中,ACT 相对先前方法在不同数据来源和任务上提升约 20–59 个百分点。更关键的是,ACT 的优势并非来自更长的输入历史,而是来自动作块降低有效 horizon、temporal ensemble 平滑执行,以及 CVAE 对人类示范多样性的建模。
5.2 消融:三个组件各自解决什么问题
去掉 action chunking、令 k = 1 k=1 k=1 后,综合成功率从使用 k = 100 k=100 k=100 时的约 44% 降到 1%,说明逐步预测在高频精细操作中会积累严重误差。移除 temporal ensemble 后,动作切换变得不平滑,性能也下降。
CVAE 对人类示范尤其重要:在人类数据上移除 CVAE 后,成功率由约 35.3% 降到 2%;对确定性脚本数据影响较小。这个对照支持了“人类示范包含多模态动作风格,单一回归平均值会抹掉关键动作”的解释。
作者还做了 50Hz 与 5Hz 的用户研究。6 名参与者在 50Hz 遥操作下完成任务的时间比 5Hz 快约 62%,说明高频并不是无意义地增加采样点,而是让操作者和 follower 能及时修正细小误差。

图 5:消融实验比较动作块、CVAE、控制频率等设计;动作块和示范建模对精细操作尤其关键。来源:论文 Figure 7。
猫先生认为,ACT 的成功不是“Transformer 预测得更远”这么简单,而是三个时间尺度同时对齐:动作块处理局部连续动作,temporal ensemble 处理重叠预测,50Hz 视觉闭环处理外部扰动。模仿学习的有效 horizon 被缩短后,低成本硬件才有机会稳定完成细活。
6. Limitations:低成本系统仍有清晰边界
ALOHA 不能替代灵巧手,双指夹爪难以完成儿童安全瓶、紧瓶盖和需要多指协同的操作;大力矩、重物和高阻力任务也超出其设计范围。ACT 对物体形变和视觉遮挡仍敏感:糖果包装拆解实验中,机器人可以取糖,却很难完成最后的撕开;平铺小自封袋也会在后续步骤中失败。
系统还依赖每个任务单独采集示范并从头训练 ACT,尚未形成跨任务、跨语言的通用策略。论文的贡献更准确地说是“低成本硬件 + 强数据采集 + 精细模仿算法”的可复现基线,而不是一个已经解决开放世界操作的通用机器人。
总结:先把示范采好,低成本机器人也能做精细操作
ALOHA 通过低成本 leader-follower 双臂、四路 50Hz RGB 视觉和可维修结构,把高质量双臂示范采集变成普通实验室可承担的工程;ACT 则用 action chunking、temporal ensemble 和 CVAE,把长、高频、带噪的人类轨迹转化为平滑闭环控制。六个真实任务的结果表明,约十分钟示范足以让廉价硬件获得有用的精细操作能力。
猫先生认为,ALOHA 最值得留下的经验是:**机器人学习的瓶颈常常不是策略网络本身,而是示范如何被稳定、低延迟、低成本地采集。**当硬件接口、数据频率和算法目标围绕这个瓶颈一起设计,低成本系统也可以成为高质量机器人研究的起点。
参考资料
- Zhao et al., ALOHA arXiv 页面
- ALOHA 项目组,官方项目主页
- ALOHA 项目组,论文 PDF
推荐阅读
► 技术资讯: 魔方 AI 新视界
► 项目应用:开源视界
► 技术专栏: 多模态大模型最新技术解读专栏 | AI 视频最新技术解读专栏 | 大模型基础入门系列专栏 | 视频内容理解技术专栏 | 从零走向 AGI 系列
更多推荐




所有评论(0)