0.前言

随着 Vision-Language-Action(VLA)模型、机器人基础模型(Robot Foundation Model)以及世界模型(World Model)的快速发展,具身智能(Embodied AI)正在从传统的规则驱动机器人系统,逐渐迈向以数据和大模型驱动的新阶段。

与互联网领域的大语言模型不同,机器人智能的发展高度依赖真实物理世界中的交互数据。机器人不仅需要理解环境中的视觉信息,还需要学习复杂的动作策略、空间关系以及任务执行过程。然而,目前高质量机器人数据仍然面临采集成本高、任务覆盖有限、数据模态单一以及规模化困难等挑战,成为限制具身智能模型进一步发展的关键瓶颈。

本文整理公开论文与项目资料中,采用松灵机器人(AgileX Robotics) Cobot Magic 进行数据采集、实验验证或平台搭建的部分研究案例。

关键词:具身智能,松灵机器人,机械臂,Mobile ALOHA,具身智能数据采集

以下内容基于公开论文及项目主页整理,仅用于技术交流,不代表相关研究由 松灵机器人(AgileX Robotics) 主导完成。

1.为什么具身智能需要真实世界数据?

过去几年,以大语言模型(Large Language Model, LLM)为代表的人工智能技术取得了突破性进展。通过在互联网规模文本数据上的预训练,LLM 学习到了丰富的语言知识和推理能力,实现了从文本理解到内容生成的跨越。

其核心学习范式可以概括为:

Text Data

Transformer Model

Language Intelligence

然而,当人工智能从数字世界走向物理世界,机器人所面对的问题变得更加复杂。机器人不仅需要理解语言,还需要感知真实环境、理解空间关系,并通过连续动作与环境进行交互。因此,一个具备智能能力的机器人系统需要同时处理:

  • 视觉感知(Vision):理解周围环境和物体状态;

  • 语言理解(Language):理解人类指令和任务目标;

  • 动作决策(Action):生成可执行的机器人控制策略;

  • 环境反馈(Environment Feedback):根据实际执行结果不断调整行为。

其学习过程更接近:

Observation

Robot Policy Model

Action

Environment Interaction

New Observation

这意味着,机器人智能的发展不再只是模型规模的竞争,而是转向了真实世界交互数据的竞争。与互联网文本数据相比,机器人数据具有更高的获取难度:

  • 一个语言模型可以通过网页、书籍快速获得数十亿级文本;

  • 但机器人学习一个简单操作任务,需要在真实环境中经历大量感知、决策和执行过程。

例如,一个机器人学会“拿起杯子”这一动作,需要同时学习:

  • 杯子的视觉特征;

  • 手臂运动轨迹;

  • 抓取力度;

  • 空间位置关系;

  • 动作失败后的调整策略。

因此,当前具身智能发展的核心瓶颈正在逐渐从模型架构创新转向高质量真实机器人数据的获取与利用能力。未来的机器人基础模型(Robot Foundation Model)以及 Vision-Language-Action(VLA)模型,需要依赖大规模、多模态、可扩展的真实世界交互数据进行训练,而如何高效构建覆盖感知、决策与执行全过程的数据闭环,已经成为推动具身智能进一步发展的关键问题。

在这一背景下,全球众多高校、科研机构和人工智能实验室开始投入具身智能数据基础设施建设,围绕真实机器人交互数据采集、机器人操作数据集构建以及基础模型训练展开探索。研究人员通过搭建不同类型的机器人平台,采集涵盖视觉、语言、动作、状态反馈等多模态数据,推动机器人从“基于规则执行任务”向“通过数据自主学习和泛化能力”演进。

基于这一需求,松灵的Cobot Magic具身智能套件提供了一套面向机器人学习研究的数据采集解决方案,通过协作机器人平台、多模态传感系统以及开放式软件接口,帮助研究人员快速构建从真实环境交互到模型训练的数据闭环。

松灵机器人数采方案

2.论文模型

1.智源具身智能-RoboCOIN

An Open-Sourced Bimanual Robotic Data COllection for INtegrated Manipulation

项目主页:RoboCoin 项目地址

为解决当前机器人数据规模不足、本体异构、语义标注缺失等问题,北京智源研究院联合国内外30余家机构推出 RoboCOIN——面向多本体双臂操作的大规模开源机器人数据集。

该数据集包含超过18万条真实机器人操作轨迹,覆盖421类任务、15种异构机器人平台以及16类真实环境,并通过人类遥操作方式采集多视角RGB-D视觉数据、机器人关节状态和动作轨迹,实现跨平台、多模态的数据统一。同时,RoboCOIN提出了层级能力金字塔(Hierarchical Capability Pyramid)标注体系,从任务描述、动作阶段到帧级运动状态对机器人行为进行结构化表达,使模型不仅能够学习“如何执行动作”,还能理解“任务目标与动作逻辑”。在该项目中,松灵COBOT MAGIC具身智能套件完成部分数据采集以及实验认证,实验结果表明,引入结构化语义标注后,机器人在复杂操作任务中的成功率得到显著提升,证明了高质量真实世界数据和结构化数据体系对于提升具身智能泛化能力的重要价值。

2.极佳科技-GigaBrain-0

A World Model-Powered Vision-Language-Action Model

项目主页:GigaBrain-0

基于松灵COBOT MAGIC训练GigaBrain-0的适用场景

极佳科技提出的 GigaBrain-0 是一个面向具身智能任务的视觉-语言-动作(Vision-Language-Action, VLA)模型,旨在通过大规模、多样化的交互数据学习机器人从环境感知到动作执行的完整能力。该研究基于多种机器人硬件平台开展数据采集与模型验证,其中包含 松灵Cobot Magic 双臂机器人平台,学习物体识别、任务理解、动作规划以及精细操作等能力,能够将自然语言任务指令映射为机器人可执行动作。

GigaBrain-0 具备视觉理解、任务语义解析以及连续动作生成能力,能够根据自然语言指令和环境观测自主规划机器人操作策略,并在真实机器人平台上完成衣物整理、物体抓取、物品放置等复杂任务。该模型验证了“世界模型生成数据 + VLA策略学习 + 真机部署”的具身智能训练范式,为降低机器人数据采集成本、提升模型泛化能力提供了新的技术路径。

此外 GigaBrain-0 模型突破了传统机器人策略模型高度依赖真实交互数据的限制,通过结合 GigaWorld-0 世界模型生成的高保真合成数据进行训练,使机器人能够在无需真实数据微调的情况下,实现从虚拟环境到真实场景的零样本迁移。

3.清华大学-XVLA

Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model

项目地址:X-VLA

基于松灵 COBOT-MAGIC摇操平台实现X-VLA模型的数据采集

清华大学智能产业研究院(AIR)与上海人工智能实验室联合提出了全开源通用跨本体具身智能基座模型 X-VLA(Cross-embodiment Vision-Language-Action Model),旨在解决当前机器人基础模型在不同机器人平台间泛化能力不足的问题。X-VLA 通过融合大规模异构机器人操作数据,引入面向机器人本体泛化的 Soft-Prompt 机制、多模态视觉编码策略以及基于 Flow Matching 的生成式动作解码器,实现了视觉、语言与机器人动作之间的统一建模。该模型仅以 0.9B 参数规模,在 LIBERO、SIMPLER 等多个权威仿真基准中达到领先性能,并首次实现无需人工干预的超长时序自主叠衣任务。研究团队通过高质量机器人数据预训练、多模态数据清洗与时空对齐、语义-动作关联筛选等方法,提升了模型对不同机器人结构、任务场景和操作环境的适应能力。松灵COBOT MAGIC 双臂具身遥操作平台参与部分数据采集与任务验证工作,实现了从数据采集、模型训练到实际任务执行的完整闭环,为构建通用型机器人基础模型提供了新的技术路径。

4.蚂蚁灵波 -LingBot-VLA

A Pragmatic VLA Foundation Model

项目地址:LingBot-VLA

基于松灵COBOT MAGIC等具身机器人搭建LingBot-VLA模型

在具身智能(Embodied AI)领域,如何构建具备跨任务、跨机器人平台泛化能力的视觉-语言-动作(Vision-Language-Action, VLA)模型,是推动机器人从专用自动化系统走向通用智能体的关键挑战。蚂蚁灵波科技提出并开源的 LingBot-VLA,通过大规模真实机器人交互数据训练,为机器人通用操控提供了一种高效的数据驱动解决方案。松灵COBOT MAGIC 双臂遥操平台作为被用于论文公开实验中的数据采集平台之一,累计采集近2万小时真实世界操作数据,覆盖摆盘、插花、拧螺丝等多样化任务场景,使模型能够学习更加贴近实际应用的机器人操作策略。

LingBot-VLA区别于传统依赖仿真数据训练的方法,通过真实机器人数据建立视觉、语言与动作之间的关联,并展现出随着数据规模增长持续提升的性能潜力。在GM-100真实机器人任务基准测试中,该模型在包括 AgileX Cobot Magic 在内的多种机器人平台上完成跨本体验证,表现出较强的任务泛化能力和实际部署能力。

在技术架构方面,LingBot-VLA采用基于视觉语言模型的混合 Transformer 架构,将高层语义理解能力与机器人动作生成模块相结合,并通过 Flow Matching 连续动作建模方法生成更加平滑稳定的控制轨迹。同时,模型引入视觉蒸馏增强空间感知能力,使机器人能够更精准地完成抓取、堆叠等复杂操作任务。通过高效训练框架优化,LingBot-VLA进一步降低了大规模机器人模型训练的算力成本,为具身智能模型从实验研究走向实际应用提供了新的技术路径。

5.智元机器人 -Genie Envisioner

A Unified World Foundation Platform for Robotic Manipulation

项目地址:Genie Envisioner

基于松灵COBOT MAGIC等具身机器人搭建Genie Envisioner模型实操画面

针对当前机器人策略学习、仿真评估以及数据闭环训练相互割裂的问题,智元机器人研究团队提出了 Genie Envisioner(GE),一个融合世界模型、策略学习与机器人仿真的统一具身智能基础平台。

Genie Envisioner 以 GE-Base 为核心,通过大规模、指令条件化的视频扩散模型学习真实机器人交互过程中的空间结构、时间动态以及任务语义信息,并将复杂的物理交互过程编码到结构化潜空间中。在此基础上,GE-Act 利用轻量级 Flow Matching 动作解码器,将世界模型中的潜在状态表示映射为可执行的机器人动作轨迹,使模型能够在不同机器人本体之间实现更加精准和泛化的策略推理。

为了支持机器人策略的持续训练与验证,研究团队进一步构建了 GE-Sim 动作条件神经仿真器,通过生成高保真的未来环境演化过程,为机器人策略提供闭环测试与优化环境。同时,配套提出的 EWMBench 基准评测体系,从视觉真实性、物理一致性以及指令-动作匹配能力等多个维度,对世界模型生成能力进行系统评估。

整体而言,Genie Envisioner 将世界模型生成、机器人策略学习、仿真评估整合到统一框架中,为构建面向多任务、多机器人平台的通用具身智能系统提供了一种新的技术范式,也进一步推动机器人从“依赖大量真实试错数据”向“利用世界模型进行预测、学习和规划”的方向发展。

3.结语:开源与未来方向

随着具身智能研究不断向大规模数据训练和基础模型方向发展,真实世界机器人交互数据的重要性日益凸显。未来,机器人平台的价值不仅体现在硬件本身,更在于其能否为智能模型提供稳定、高质量的数据采集与验证环境。基于 松灵Cobot Magic 构建的数据采集系统,为机器人学习研究提供了从真实任务交互、多模态数据记录,到模型训练与策略验证的完整实验流程。通过与 Vision-Language-Action(VLA)模型、机器人基础模型(Robot Foundation Models)、世界模型(World Models)以及 Robot Agent 等研究方向结合,研究人员可以进一步探索,研究人员可以进一步探索机器人感知、决策与执行能力的统一学习方法。

未来,随着 Vision-Language-Action(VLA)、Robot Foundation Models、World Models 与 Robot Agent 等技术持续发展,研究人员将进一步探索机器人感知、决策与执行能力的统一学习方法。

FAQ

Q1:为什么具身智能模型需要真实机器人数据?

Vision-Language-Action(VLA)模型、机器人策略模型(Robot Policy)以及机器人基础模型(Robot Foundation Model)等具身智能模型,需要学习的不仅是视觉信息和语言指令,还包括机器人在真实物理环境中的动作规律和交互反馈。与大语言模型依赖文本数据不同,机器人需要通过大量真实操作数据理解空间关系、物体状态以及动作结果。因此,高质量、多模态的真实机器人数据是提升模型泛化能力和任务执行能力的重要基础。

Q2:为什么机器人数据采集比传统 AI 数据采集更困难?

机器人数据采集需要在真实物理环境中完成,涉及机器人硬件、传感器、控制系统以及任务设计等多个环节。相比文本或图像数据,机器人数据具有更高的复杂性:

  • 数据采集成本更高,需要真实机器人执行任务;

  • 数据维度更多,需要同步视觉、状态和动作信息;

  • 数据质量要求更高,需要保证轨迹连续性和动作有效性;

  • 场景泛化困难,需要覆盖不同任务和环境。

因此,构建稳定的数据采集流程是具身智能研究的重要基础。

Q3:机器人数据采集平台为什么需要支持多模态数据?

机器人执行任务时,需要同时理解环境信息和自身运动状态。单一视觉数据只能描述“机器人看到了什么”,但无法完整表达“机器人如何运动”。多模态数据融合能够让模型同时学习:

  • 环境视觉信息;

  • 物体空间关系;

  • 机器人运动状态;

  • 动作执行过程。

这种数据形式更接近真实机器人任务,有助于提升模型在复杂环境中的泛化能力。

Q4:真实机器人数据相比仿真数据有什么优势?

仿真数据具有规模大、生成成本低等优势,但与真实环境之间存在 Sim2Real 差距,例如:

  • 光照变化;

  • 物体材质差异;

  • 传感器噪声;

  • 真实物理交互误差。

真实机器人数据能够直接反映物理世界中的复杂因素,使模型学习更加符合实际部署需求。因此,真实数据和仿真数据结合成为当前具身智能研究的重要方向。

Q5:松灵 Cobot Magic 采集的数据可以支持哪些机器人任务?

基于双臂机器人操作平台,研究人员可以采集多种类型的机器人任务数据,例如:

  • 物体抓取与放置;

  • 桌面整理;

  • 双臂协同操作;

  • 装配任务;

  • 工业操作流程;

  • 长时序任务执行。

这些数据可用于研究机器人操作策略学习和任务泛化能力。

Logo

电影级数字人,免显卡端渲染SDK,十行代码即可调用,工业级demo免费开源下载!

更多推荐