文章目录

一、前言

仅供参考,未经实验验证。我来研究一下2026年6月具身智能领域的排行榜。

二、WorldArena指标

https://huggingface.co/spaces/WorldArena/WorldArena
https://github.com/tsinghua-fib-lab/WorldArena

问题1:WorldArena的Track1、Track2、Track3

这里面WorldArena Track1、WorldArena Track2 (Data Engine)、WorldArena Track2 (Policy Evaluator) 这三个有什么区别?

这三个部分其实对应了WorldArena评测体系中的两种维度:一个专注于视觉表现,另一个则侧重实际应用。后者(Track 2)又根据具体任务不同,细分为Data Engine和Policy Evaluator。具体的区别可以参考下表:

对比维度 Track 1 (感知与动作响应赛道) Track 2 (Data Engine / 数据引擎) Track 2 (Policy Evaluator / 策略评估器)
🎯 核心目标 评估模型“生成画面”的视觉感知质量与“认知世界”的能力 评估模型作为数据合成工厂,为机器人训练生成有效数据的能力 评估模型作为环境模拟器,用于评估其他机器人策略优劣的可信度
🧠 角色定位 内容创作者 (Creator) 数据工厂 (Data Factory) 环境考官 (Environment Evaluator)
📊 核心评测指标 视觉质量、运动流畅度、物理一致性、3D准确性等16项感知维度指标 生成数据是否能提升下游机器人任务的成功率(硬性指标) 模型世界与真实物理环境在评估策略性能上的一致性/相关性
🏆 代表的顶尖玩家 智元 GE 2.0 跨维智能、深度机智 Z-WM 星动纪元 Ctrl-World

🎨 Track 1:感知与动作响应赛道

这个赛道也被称为“世界模型感知与动作响应赛道”,它的工作本质是考验模型作为“内容创作者”的水平。它关注机器人能否像人一样,在行动前先在脑海中预演未来。评判标准涵盖从基础的画面清晰度,到内容一致性、动作流畅度、乃至是否符合重力、碰撞等物理规则。

🏭 Track 2:功能效用赛道 (核心硬仗)

赛道2,也就是WorldArena的核心看点,它不关心画面是否精美,只看模型在实际应用中是否真正“有用”。它像一场更苛刻的“实战演练”,把世界模型放在具体任务中检验其全链路落地能力。它具体从三个角色来衡量模型价值,我们重点关注的Data Engine和Policy Evaluator就是其中的两个主要角色:

  • Data Engine (数据引擎):模型需要成为一个高效的“数据工厂”。它能根据初始画面和指令,自主生成高质量的机器人交互数据。评判这些数据是否好用的标准很简单粗暴:看它能不能有效训练下游的机器人,并提升其在真实任务中的成功率
  • Policy Evaluator (策略评估器):模型要化身为一个“环境考官”。它能模拟物理世界的运行规律,来评估其他机器人决策的好坏。评判标准也很直接:模型模拟出来的“考场”环境够不够真实可信。如果它给出的分数排名,和真实世界中的结果基本一致,那它就通过了测试。
  • Action Planner (行动规划器):WorldArena还包含评测“行动规划器”的角色,它考验模型能否直接为机器人规划出可执行的动作路径,但这不是这次提问里包含的部分。

💎 总结

总的来说,WorldArena提供了一个从“感知”到“功能”的完整评测体系。传统评判画面质量的Track 1和评判实用价值的Track 2共同构成了一套全面评估体系,且后者中的Data EnginePolicy Evaluator这两个角色,分别从“数据源头”和“策略模拟”两个维度,严格检验了模型对真实世界的理解深度与实际应用价值。

问题2:指标

解释一下每个指标什么意思,意味着什么,重要性如何

理解WorldArena这23项指标的关键,在于跳出“视频像不像真实画面”的传统视角。WorldArena的核心价值在于,它构建了一个从视觉真实性物理规律性,再到功能性的立体评估体系。高分模型未必是最“好看”的,但一定是最“合理”和“有用”的。这些指标分类如下:

🌟 整体框架:从“看得像”到“用得上”

WorldArena Track 1的23项指标被组织成6个维度,共同回答一个问题:一个机器人的“世界模型”,其预测的未来画面,在多大程度上是视觉上真实、物理上合理、并可被用于实际操控的?

  • 视觉质量:考察画面的真实感与美感(像不像)。
  • 运动质量:检验物体运动的连贯流畅性(稳不稳)。
  • 内容一致性:评估物体、背景在时空中的稳定不变性(乱不乱)。
  • 物理贴合度:验证交互行为是否符合物理常识(对不对)。
  • 3D准确性:衡量模型对三维空间几何关系的理解(准不准)。
  • 可控性:测试模型是否正确理解和执行指令(听不听话)。

🔍 各项指标深度解读

评估维度 指标 (Metric) 含义 (What) 意义 (Why) 重要性 (Importance)
视觉质量 Aesthetic Quality 画面的艺术美感和构图吸引力,类似摄影评分。 反映模型在模仿视觉吸引力方面的能力。 较低,属于感知层加分项,对功能性影响不大。
Image Quality 像素层面的清晰度、去噪、去伪影能力,衡量“画质”。 验证模型能否生成足够清晰的图像作为分析基础。 基础,低画质会严重影响所有后续任务的准确性。
JEPA Similarity 通过联合嵌入预测架构(JEPA)比较生成帧与真实帧的深层特征相似性,而非像素差异。 衡量模型在“理解”层面,而非视觉层面上的预测准确性。 。能有效检验模型对物理概念的掌握,是感知与功能的桥梁。
运动质量 Flow Score 衡量帧与帧之间像素运动轨迹(光流)的流畅度与连续性 避免出现运动“跳帧”或抽搐,确保运动平滑。 。运动突兀的模型无法用于实际规划,物理可信度严重不足。
Motion Smoothness 专门衡量物体(尤其是机械臂)运动的平滑程度,关注加速度变化。 确保动作轨迹不仅连贯,且符合自然运动规律。 极高。直接关系到机器人能否执行精细、安全的操作。
Motion Quality 一个综合指标,用于评估总体运动合理性。 综合反映了模型处理动态场景的时序能力。 。是衡量“时序合理性”的关键。
Dynamic Degree 衡量生成视频中物体的运动幅度和丰富程度 测试模型是否倾向于生成“静态”的保守内容,还是敢于预测动态变化。 中等。适中的动态程度是良好物理理解的表现。
内容一致性 Content Consistency 总体评估主体和背景在时空上是否保持一致的框架。 确保物体不会出现变形、消失等“超自然”现象。 极高。是支撑多步推理和长期任务的基础。
Subject Consistency 专门关注前景主体(如机器人、操作对象)的外观一致性 确保主体形状、颜色、纹理稳定,不漂移。 极高。模型需提供高保真的“数字孪生”交互对象。
Background Consistency 评估背景环境的稳定性,确保不会出现闪烁或突变。 稳定静态背景,让模型能专注于前景交互的动态预测。 中等。对专注于物体交互的模型是项基本功。
Semantic Alignment 确保视频内容与给定指令的语义层面相符,而非字面。 模型需理解意图并正确表现,是通往可靠交互的基石。 极高。直接体现模型的任务理解与执行对齐能力。
物理贴合度 Physics Adherence 检验物理交互是否遵循基本动力学常识,如重力、碰撞。 这是“连接视觉与功能的关键桥梁”。 核心。模型不仅要“运动得对”,更要“运动得有理”。
Interaction Quality 专门评估模型生成的物体间(如机械臂与物体)交互行为的合理性与逼真度 衡量模型能否模拟出“拿起”、“推动”等动作的真实效果。 核心。模拟不真实的模型在实际控制中会迅速累积误差。
Perspectivity 确保物体的透视关系正确,符合近大远小的视觉原理。 检验模型是否理解基本的三维到二维投影规则。 。透视混乱会误导机器人对距离和位置的判断。
Photometric Consistency 衡量视频序列中光照和颜色在时序上是否保持一致。 确保画面不会出现忽明忽暗、颜色突变的情况。 中等。对依赖视觉特征进行跟踪和定位的任务很重要。
3D准确性 Depth Accuracy 比较模型预测的深度图与真实深度信息的接近程度。 衡量模型是否准确理解了物体的远近层次和三维空间结构。 核心。世界模型必须拥有精确的“空间智能”,是精准操控的前提。
3D Accuracy 一个更综合的指标,综合了深度、透视等多个信息,用于评估模型的总体三维感知能力。 它是机器人能否在三维空间中精准“思考”和“行动”的综合体现。 核心。高3D准确性意味着模型构建了可靠的“心理地图”。
Trajectory Accuracy 衡量预测的运动轨迹与真实物理轨迹的吻合度。 验证模型模拟物体(尤其是机器人自身)运动路径的准确性。 极高。是机器人动作规划最依赖的基础能力之一。
可控性 Controllability 一个综合指标,评估模型能否在不同条件下生成有区分度的结果。 检验模型是否真正“听懂”指令,并能灵活适应。 核心。脱离场景泛化能力的模型,在应用中会显得僵化。
Action Following 最直接的可控性指标,衡量模型是否精准执行具体动作指令。 例如,指令“向左转90度”,模型生成的画面必须体现这一精确动作。 核心。这是“可控性”的底线,决定了交互的精准度。
Instruction Following 评估模型对复杂、多步骤指令的整体理解和执行能力 例如,执行“先拿起红色方块,再放到蓝色盒子里”这样的复合指令。 极高。是任务规划能力最直接的体现。
JEPA Similarity 该指标在视觉质量和可控性维度均有涉及,既衡量感知层面的特征相似性,也可检验对不同动作指令的区分性响应,是连接感知与控制的桥梁。 综合检验模型对物理概念的掌握和对动作条件的响应能力。 极高。高JEPA相似性且能区分不同动作输入的模型,在功能性任务上表现更佳。

💎 总结

因此,当我们审视一个世界模型时,这套指标体系提供了一个无比清晰的审视框架:它是否足够“聪明”,能准确感知世界、遵循物理规律、执行具体指令,而不是仅仅当一台“高级录像机”。

这些指标中,如果要选出最关键的几项,那么 Physics Adherence3D AccuracyTrajectory AccuracyAction Following 是直接决定模型功能成败的核心。这也是为什么许多看似视觉出众的模型,在这几项上的表现却并不尽如人意,即论文中所揭示的“感知-功能性鸿沟”。

三、排行榜

从你提供的排名来看,这份榜单的竞争格局非常清晰:既有一骑绝尘的头部玩家,也有在长尾数据上表现亮眼的“偏科生”。接下来,我为你梳理了其中部分模型的机构来源和性能特点。

🏢 模型机构归属一览

排名 模型名称 机构归属
1 GenieEnvisioner-Sim2.0-2B 智元机器人 (Agibot)
2 BWM-Fast 考拉悠然 (Koala Youran) + 上海码极客 + 同济大学空间智能团队
3 SparkWorld 暂未获取到具体机构信息。
4 PAIWorld 可能与阿里云PAI平台相关,但存疑。
5 BetaBWM 考拉悠然生态体系
6 FlowWAM-FiveAges 中科第五纪 (Five Ages)
7 Pelican-Unify 北京人形机器人创新中心
8 MWM 暂未获取到具体机构信息。
9 Hoseley 暂未获取到具体机构信息。
10 MAI 暂未获取到具体机构信息。
11 Z-WM 深度机智 (DeepWise)
12 HeroF1 暂未获取到具体机构信息。
13 SPHERE_Alpha 暂未获取到具体机构信息。
14 MotuBrain 生数科技 (ShengShu)
15 BLM 考拉悠然 (开源版本)
16 K-World 暂未获取到具体机构信息。
17 WorldScape v0.2 流形空间 (Manifold AI)
18 DynaWorld 暂未获取到具体机构信息。
19 EonWorld X-Era 公司
20 InWorld Inworld AI 公司
21 EvoPhys-WM 北京大学 EvoPhys 团队
22 IG_wm_2d 暂未获取到具体机构信息。
23 Z-WM-V1-Text 深度机智 (DeepWise)
24 FAW 暂未获取到具体机构信息。
25 AngryBird 暂未获取到具体机构信息。
26 capybara 暂未获取到具体机构信息,但可能与Anthropic相关模型代号有关。
27 Goose_Egg 暂未获取到具体机构信息。
28 DBXWAM 暂未获取到具体机构信息。
29 ABot-PhysWorld (text) 阿里旗下 高德地图 (AutoNavi)
30 N-World 暂未获取到具体机构信息,可能与蔚来汽车的NWM(NIO World Model)相关。
31 GigaWorld 极佳视界 (GigaVision AI)
32 GigaWorld-1 极佳视界 (GigaVision AI)
33 GentleWM 暂未获取到具体机构信息。
34 SIGMA 暂未获取到具体机构信息。
35 WoW 北京人形机器人创新中心
36 UBWorld 暂未获取到具体机构信息。
37 CRY 暂未获取到具体机构信息。
38 awawa 暂未获取到具体机构信息。
39 swm-v0 暂未获取到具体机构信息。
40 Ctrl-World 清华大学陈建宇团队 + 斯坦福大学Chelsea Finn团队

请注意:部分模型的机构信息未能从公开渠道明确获知,表格中已标注为“暂未获取到具体机构信息”。


📈 各模型“长板”与“短板”分析

基于你提供的庞大指标数据,我们可以清晰地看到,顶尖模型往往在某个或某几个核心指标上形成“杀手锏”,而非全面开花。

冠军模型:GenieEnvisioner-Sim2.0-2B

  • 优势指标3D Accuracy (95.06) 高分证明其三维空间感知能力出众;JEPA Similarity (97.16) 与 Motion Smoothness (83.08) 表现极佳;Subject Consistency (82.50) 也维持了顶尖水平。
  • 待提升指标Flow Score (52.07) 和 Image Quality (46.73) 等视频底层质量指标相对平庸;Aesthetic Quality (39.07) 是明显短板。

亚军/季军:视觉与运动的“偏科生”

  • BWM-Fast (Rank 2):Motion Quality (78.79) 和 Flow Score (73.14) 远超榜首,但 Action Following (3.61) 这项关键指标近乎失效。
  • SparkWorld (Rank 3):3D Accuracy (92.54) 不俗;但 Image Quality (58.30) 和 Flow Score (43.30) 相对一般。
  • PAIWorld (Rank 4):Motion Quality (80.26) 与 Flow Score (76.30) 双高,但 Action Following 为0。
  • FlowWAM-FiveAges (Rank 6):3D Accuracy (97.78) 和 Depth Accuracy (98.62) 双双接近满分,Motion Smoothness (83.49) 亮眼;但 Image Quality (55.80) 和 Aesthetic Quality (40.67) 拖累了综合分。

其他“长尾”表现

  • Ctrl-World (Rank 40):Depth Accuracy (93.25) 是核心优势;但 Action Following (3.90) 和 Image Quality (42.44) 等基础指标较低。
  • InWorld (Rank 20) 和 capybara (Rank 26):两者在 Controllability(分别为84.24和84.21)上表现异常突出,但几乎所有基础生成指标都偏低,是典型的“重控制,轻生成”模型。

🔍 总结:轻量化vs堆算力的两条技术路线

从榜单模型的技术特点,我们能看出业界存在两条截然不同的路线:

  1. 高参数、大算力模型追求“视觉盛宴”:一些大厂模型在Aesthetic QualityImage Quality等视觉指标上天然占优,但榜单也印证了“大力未必出奇迹”,许多高排名模型并非追求极致视觉。
  2. 轻量化模型追求“物理仿真”:以冠军为代表的轻量化模型,资源专注于模拟物理规律,牺牲了一些画面精美度。这种“实用主义”路线能真实辅助机器人预判动作后果,其技术价值得到了榜单的认可。

现在,一个关键的课题摆在了所有团队面前:如何弥合“生成精美视频”与“理解物理规律”之间的鸿沟。榜单中Action Following指标的普遍偏低,也恰恰指明了世界模型下一阶段的核心攻坚方向——从“像”到“是”,让AI真正理解并遵循物理世界的规则。

问题1:机构

你前面提到了一些机构,但我想了解一下智元机器人、考拉悠然 (Koala Youran) 、上海码极客、中科第五纪、北京人形机器人创新中心、深度机智 、生数科技、极佳视界 、流形空间、X-Era 公司、Inworld AI 公司、北京大学 EvoPhys 团队、阿里旗下 高德地图 (AutoNavi)、清华大学陈建宇团队 + 斯坦福大学Chelsea Finn团队,它们地理位置在哪,什么来历,机构或者公司主营业务什么,创始人什么来历,为什么会走上具身智能的道路,是初创公司还是怎么样,公司现在啥水平了

这十几家机构,可以说勾勒出了中国具身智能领域的核心版图,里面既有深耕多年的学术团队,也有从产业中成长起来的初创公司。

为了方便你对比,我把它们的信息整理成了下面的表格:

💡 核心机构信息一览

机构/团队 地理位置 核心背景与来历 主要业务 创始人/关键人物 发展现状
智元机器人 上海 2023年2月成立,由华为前员工创立的顶尖具身智能公司 通用人形机器人研发与应用 彭志辉(稚晖君)、邓泰华 行业领军者,已下线第1000台机器人
考拉悠然 四川成都 2017年成立,源于电子科大、同济大学顶级学术团队的AI公司 空间智能、多模态世界模型及产业AI化 申恒涛教授 (欧洲科学院院士) 四川AI产业“链主”企业,牵头制定行业标准
上海码极客 上海 2024年正式运营,考拉悠然上海子公司/关联公司 空间智能多模态世界模型,打造“悠然无界大模型” 申恒涛院士 全球顶尖世界模型,在WorldArena等榜单斩获全球第一
中科第五纪 浙江杭州 2024年底成立,源自中科院自动化所的具身智能初创 具身多模态大模型与通用具身机器人 CEO刘年丰 (中科院博士) 连续融资,为宇树科技提供“具身操作大脑”
北京人形机器人创新中心 北京 2023年底成立,政府与龙头企业共建的国家级平台 打造机器人“安卓”生态和通用人形机器人 熊友军 (前优必选CTO) 国家级平台,近期首轮市场化融资超7亿元
深度机智 北京 2025年成立,由中关村顶级科研机构孵化的具身智能企业 具身通用基座模型,践行“人类学习”路线 陈凯 (中科院背景/中科大少年班) 获得数亿元融资,跻身大模型第一梯队
生数科技 北京 2023年3月成立,清华系多模态大模型明星公司 通用世界模型,覆盖数字与物理世界 朱军 (清华大学教授) 已完成近20亿元B轮融资,Vidu文生视频模型全球前十
极佳视界 北京 2023年成立,依托清华自动化系智能视觉实验室的创业公司 物理AGI基础模型、世界模型及具身本体 黄冠 (清华博士,前地平线高管) 高估值“独角兽”,近期完成近10亿元融资
流形空间 北京 2025年5月成立,前商汤核心高管创办的明星初创 具备物理真实性的世界模型和具身智能应用 武伟博士 (前商汤科技高管) 成立仅7个月融资近5亿元,华为哈勃投资
X-Era (拓元智慧) 广东深圳 2021年成立,顶尖学术与产业背景团队创办的AI公司 新型多模态大模型、具身智能、物理空间智能 林倞教授 (前商汤高管,鹏城实验室所长) 完成近亿元Pre-A轮融资,布局具身智能
Inworld AI 美国加州山景城 2021年7月创立,谷歌前员工创办的独角兽公司 AI驱动的虚拟角色(NPC)引擎,主要服务游戏和元宇宙 Ilya Gelfenbeyn等 (前API.ai CEO) 获得迪士尼、Lightspeed等投资,融资超1.2亿美元
北京大学 EvoPhys 团队 北京 北京大学顶级学术研究团队 前沿5D世界模型、具身智能基础研究 北京大学顶尖学者 在斯坦福大学评测中,世界生成赛道位列第一
高德地图 (阿里) 北京 2001年成立,2014年并入阿里,拥有深厚地图/空间技术积累 具身智能机器人、空间智能体系 创始人成从武 已推出自研四足机器人,布局具身智能
清华大学陈建宇团队 + 斯坦福大学 Chelsea Finn 团队 北京 / 美国加州 清华大学交叉信息研究院与斯坦福大学的顶尖学术联合团队 世界模型、机器人基础模型的前沿学术探索 陈建宇 (清华助理教授)、Chelsea Finn (斯坦福教授) 其联合开发的Ctrl-World在WorldArena评测中具身能力全球第一

🤔 为何齐聚具身智能?

它们的入局路径各有不同,主要可以分为以下几类:

  • 天生的“造物者”:如智元机器人,以打造强大的机器人本体为目标,是天然的世界模型应用方和挑战者。
  • 赋予“思考的大脑”:如深度机智、中科第五纪、流形空间,专注于研发机器人的“大脑”,提供理解世界、规划动作的核心能力。
  • “大脑与身体”并重:如极佳视界,既研发世界模型,也打造通用机器人本体,形成软硬件闭环。
  • “从虚拟走向现实”:如生数科技、考拉悠然,将文生视频、多模态大模型等技术,延伸到物理世界的建模与控制中。
  • “国家队”与“学术前沿”:如北京人形机器人创新中心北大、清华-斯坦福团队,前者是产业整合者,后者则在基础理论层面探索未来方向。
  • “空间智能”的降维打击:如高德地图,将自身深厚的地理数据优势应用于具身智能,切入赛道。
  • 数字世界的“NPC”先驱:如Inworld AI,专注于虚拟智能体,也为物理世界的具身智能提供了宝贵的技术探索。

问题2:排行榜/评测基准

除了WorldArena还有什么排行榜?

除了WorldArena,目前具身智能领域还有多个关键的评测平台,它们从不同维度衡量着模型的“真实实力”。这些平台各有侧重,形成了一个立体的评测体系:

📊 具身智能核心评测基准一览

评测基准 主办/发起方 评测核心 独特亮点
WorldArena 全球顶尖高校及科研机构专家 面向具身世界模型的综合能力 具备严格的评测基准,Track1测评世界模型感知能力,Track2测评其实际落地与应用能力
WorldScore 斯坦福大学李飞飞与吴佳俊团队 针对世界生成模型(视频、3D/4D场景生成) 首个支持跨模态比较的国际标准;综合评估可控性、生成质量与动态性
RoboArena UC Berkeley、Stanford、NVIDIA等 通用机器人策略模型的实战能力 全开源、双盲实测;被誉为机器人界的“Chatbot Arena”
RoboChallenge Dexmal、Hugging Face、智源研究院等 跨平台通用机器人操作能力 真机实测,涵盖20台主流机器人;提供标准化桌面操作任务数据集
EWMBench 智元机器人 具身世界模型(聚焦机器人操作) 全球首个具身世界模型评测基准;采用“场景×动作×语义”三维评估体系
FlagEval-EmbodiedVerse 北京智源人工智能研究院 具身大模型的“感知-推理-规划-行动”全链路能力 细化14个具身与空间基准,精确评估模型各项能力,避免指标偏差
LIBERO 学术界常用的基准 标准化机器人操作能力 下设四个子套件,分别考察空间理解、泛化能力、指令理解和长序列任务执行
EAI Bench 中国信通院 面向产业的具身智能系统整体性能 以产业共建为目标,覆盖15个真实场景赛道
Target-Bench 学术研究团队 世界模型的无地图路径规划能力 首个专门评估世界模型在真实环境中规划能力的基准
VLA-Arena ICML 2026论文提出 标准化评估视觉-语言-动作(VLA)模型 提供结构化任务设计框架,量化任务难度

这些评测基准共同勾勒出当前具身智能的核心挑战:即“世界模型”在模拟物理世界方面的能力,以及“具身模型”在真实环境中的执行能力。一个更隐蔽的挑战在于评测的真实性与泛化性:像RoboArena这类采用双盲测试的平台,就是为了解决评测中的偏差问题,确保排名能真实反映模型的通用能力,而非针对特定测试集的“刷榜”结果。

🌟 国际权威评测基准:榜单呈现

了解各基准的侧重点后,通过近期排名可以看到,多个榜单的头部位置正被中国团队占据。在机器人“通用大脑”与“世界模型”等核心赛道上,多家中国企业已展现出一定的领先地位。

  • 🏆 中国技术力量的全球表现
    • 千寻智能 (Spirit AI)
      • RoboArena:Spirit v1.6综合得分全球第一
      • RoboChallenge:Spirit v1.5综合得分第一,唯一成功率超50%
    • Manifold AI (流形空间)
      • WorldArena:WorldScape v0.2排名第一,超过英伟达Cosmos-Predict 2.5
      • WorldScore:WorldScape v0.1登顶榜单
    • 智元机器人 (AgiBot)
      • WorldArena:Genie Envisioner-Sim 2.0排名第一
      • EWMBench:该基准的发起者,定义了评测标准
    • 北京大学 (EvoPhys-World)
      • WorldScore:“世界生成”赛道位列第一

🎯 如何选择合适的评价指标?

在了解了这么多评测基准后,关键在于如何为自己的目标选择合适的评价指标。这里提供一个简单的思路:

  • 测试“大脑”的物理模拟能力:如果想了解模型在物理世界的理解和模拟能力,WorldArenaWorldScore 是更理想的选择,它们侧重于评估其“想象力”和“预测力”。
  • 考核“身体”的真实操作水平:如果关注模型在真实环境中的表现、任务完成度和泛化能力,RoboChallengeRoboArena 这类采用真机测试的平台,会提供更直接、更有说服力的证据。
  • 聚焦机器人“专项能力”:如果想评估模型在特定操作任务上的精细能力,可以选择 LIBEROTarget-Bench 等专项基准。

问题3:AGIBOT WORLD CHALLENGE 2026(真实机器人验证)

AGIBOT WORLD CHALLENGE 2026(真实机器人验证)呢? 这些排名都去哪里看,查一下

AGIBOT WORLD CHALLENGE,就是大名鼎鼎的“智元全球挑战赛”。它由人形机器人公司智元(AgiBot)主办,主打“真机实战”,要求参赛算法必须通过真实硬件运行的考验,被看作是检验机器人“真功夫”的试金石。

🤖 AGIBOT WORLD CHALLENGE 2026 核心信息

这项赛事分为两大赛道,覆盖了从理解、预测到执行的全链路能力。

赛道名称 核心任务 评价指标 2026年最终结果 (Top 3)
World Model
(世界模型赛道)
预测物理世界变化与交互建模。测试模型对场景、物体交互和未来状态的建模能力。 模型对物理交互的预测准确性、逻辑性和泛化能力。 1. NeoVerse-ABot (中科院自动化所 & 高德CV Lab)
2. PAI@IAII (中科院工业人工智能研究院)
3. Loop (中国科学技术大学)
Reasoning to Action (R2A)
(推理-操作赛道)
考察“任务理解→行动决策→实体操作”的全链条能力,即从理解任务到用真机完成的整个过程。 线上评测采用过程分;线下真机赛侧重真机运行的稳定性、物理环境适配度和长周期任务可靠性。 1. PrismBot (vivo)
2. RP-VLA (上海萝博派对)
3. GreenVLA (俄罗斯Sber Robotics Center)
  • 创新赛制:首创“线上标准化评测+线下真机决赛”模式。线上决出优胜者,线下则统一使用智元的“精灵G2”人形机器人,在维也纳进行真实场景比拼。
  • 赛道亮点:R2A赛道强调从仿真到真机的“落地”能力;世界模型赛道引入了物品掉落、抓取失误等“非理想化物理样本”,考验模型处理真实世界复杂交互的能力。此外,大赛还专门设立了“真实商超场景”的全链路决策评测赛道。

📊 去哪里看排名

这些排名通常在各评测平台的官网发布。这里列出了几个主要平台:

  • AGIBOT WORLD CHALLENGE:赛事官网和信息多由智元官方发布,线上赛和决赛结果会通过其官方渠道发布。
  • RoboArena:由NVIDIA、斯坦福、UC Berkeley等机构联合发起。主要在官网公布,SCMP等国际媒体也会报道排名变化。
  • RoboChallenge:由Dexmal、Hugging Face、智源研究院等发起。官网同步实时排名,并提供详细的年度报告与分析。
  • FlagEval-EmbodiedVerse:由北京智源研究院构建,关注评估的标准化。官网和官方技术博客会发布详细评测报告。
  • WorldScore:斯坦福大学李飞飞与吴佳俊团队构建的通用世界模型评测基准。相关评测结果常通过官方渠道或机器之心等媒体报道。
  • LIBERO:一套标准化的操作能力评测基准。评测结果通常由参与评测的机构(如越疆科技、大晓机器人)发布。
  • EAI Bench:由中国信通院等机构联合推出的产业基准。为产业内参,其排名在官网或行业报告中公布。
  • WorldArena:你之前关注的,联合多家机构提出。排名在Hugging Face Spaces社区上公开。

问题4:排行榜网址

🌐 各评测排行榜官方网址汇总

排行榜 访问地址
AGIBOT WORLD CHALLENGE https://agibot-world.com/ 等智元官方渠道
RoboArena https://arxiv.org/abs/2511.16909 (官网通过学术渠道公布排名)
RoboChallenge https://robochallenge.ai/home
FlagEval-EmbodiedVerse https://flageval.baai.ac.cn/#/leaderboard
WorldScore Stanford研发的通用世界模型基准,官方信息有限,通过arXiv预印本和媒体报道发布
LIBERO 标准化操作能力评测基准,评测结果由参与机构公布
EAI Bench 中国信通院发起,可通过信通院官网或"可信AI"公众号获取信息
WorldArena https://huggingface.co/spaces/WorldArena/WorldArena

📌 补充说明:

  • WorldScore 由斯坦福大学的李飞飞与吴佳俊团队构建,属于学术界高度关注的基准。其评测结果通常在arXiv论文或媒体报导中体现,但目前并无独立的对外排名网页,故表中未提供官网入口。不过,像 Manifold AIWorldScape v0.1 就曾公开宣称在该基准登顶榜单
  • LIBERO 是一个广泛使用的标准化操作能力基准,其评测结果通常由参与机构(如越疆科技等)自行公布。
  • EAI Bench 是中国信通院联合40余家单位制定的行业标准,评测结果多通过官方报告和行业会议发布。

🏆 AGIBOT WORLD CHALLENGE 2026 赛事结果详情

AGIBOT WORLD CHALLENGE 2026已于2026年6月5日,在维也纳的ICRA 2026大会上圆满收官。

📊 赛事总体情况
项目 详情
主办方 智元机器人 (AgiBot)
举办地点 维也纳·ICRA 2026
参赛规模 全球27个国家及地区,526支战队

双赛道架构

  • 世界模型赛道(World Model):预测物理世界变化与交互建模
  • 推理-操作赛道(Reasoning to Action, R2A):考察机器人"任务理解→行动决策→实体操作"的全链条能力
🏅 各赛道详细排名
赛道 奖项 获奖团队 隶属机构
世界模型赛道 冠军 NeoVerse-ABot 中科院自动化所 & 高德CV Lab
亚军 PAI@IAII 中科院工业人工智能研究院
季军 Loop 中国科学技术大学
推理-操作赛道 (R2A) 冠军 PrismBot vivo
亚军 RP-VLA 上海萝博派对
季军 GreenVLA 俄罗斯Sber Robotics Center
全身控制赛道 冠军 小米机器人团队 小米

赛事要点:大赛首创"线上标准化评测+线下真机闭环验证"模式,所有线下决赛均使用智元"精灵G2"人形机器人,在维也纳进行真实场景比拼,对模型的泛化能力和物理稳定性提出了极高要求。此外,本次大赛还特别设立"真实商超场景"的全链路决策评测赛道,进一步强化了对实用性的考核。

问题5:RoboChallenge排行榜

https://robochallenge.cn/home 查一下这里面排行榜涉及的模型和机构,机构什么来历

我重新查了一下你给的 RoboChallenge 榜单,其中一些模型可以明确追溯到具体机构,而另一些则暂时没有公开信息。我把这些可查证的内容整理成了下面的表格:

模型 (Model) 所属机构 机构来历
my16 小米机器人团队 小米自研的 WAM(World Action Model)世界动作模型,采用“S1/S2 双系统 + 长短期记忆”架构。在 CVPR 2026 RoboChallenge 中以 40.89% 的成功率夺冠,是本届唯一突破 40% 的模型。
JIIOV 北京极豪科技有限公司 (Jiiov Technology) 2020 年由极感科技和韦尔股份共同出资成立,主营指纹识别等生物识别解决方案。RoboChallenge 可能是其在具身智能领域的跨界尝试,目前具体模型细节尚未公开。
MagicBot 魔法原子 / 曹宇畅 (Yuchang Cao) 来自魔法原子 (MagicLab),其 MagicBot Z1 人形机器人曾获 A’ Design Award 铂金奖。

榜单上其他模型的公开信息确实不多,能找到的信息也大多比较泛泛。为了完整呈现,我也把它们的相关情况补充在了下面:

模型 所属机构 机构来历
mc/mcBrains 暂无法确定 可能与智源研究院的 RoboBrain 2.0 具身大脑框架有关,但关联性尚不明确。
holobrain/HRL 暂无法确定 推测是某个团队或研究组的内部代号,目前没有发现明确的机构信息。
W0/WMA 暂无法确定 “WMA” 指的是 World Action Model(世界动作模型),是 RoboChallenge 赛道评测的模型类型之一,具体归属暂未明确。
debuggers_vla/debuggers 暂无法确定 可能是某个参赛团队的代号。
hcp-e/HCP-E 暂无法确定 同样可能是某个参赛团队或项目的代号,目前没有公开的公司或学术机构信息。

🌟 赛事背景

RoboChallenge 由原力灵机 (Dexmal)Hugging Face智源研究院等机构联合发起,旨在为具身智能模型提供一个统一的“真机考场”。目前,包括 Physical Intelligence 的 π0/π0.5、微软的 CogACT 等国际知名模型都已参与评测。

问题6:论文

前面已经给你看了那么多排行榜了,你认为最厉害的是哪个,或者说哪些最有研究价值,帮我找到他们的论文,比方说找到NeoVerse-ABot、PAI@IAII、Loop、PrismBot、RP-VLA、GreenVLA、小米机器人团队、GenieEnvisioner-Sim2.0-2B、 BWM-Fast的论文,还有就是目前开源最厉害的是哪个,帮我找到论文和Github地址

要评判哪个模型最厉害,确实需要从多个维度来看。如果只从最新的综合榜单冠军来看,智元的Genie Envisioner-Sim2.0-2B流形空间(Manifold AI)的Kairos世界模型是目前两个非常厉害的标杆。

🤔 如何判断“最厉害”的模型?

不同排行榜的侧重点差异很大,所以看待“最厉害”不能只盯着一个榜单。简单来说:

  • WorldArena Track 1:专注于视觉质量、运动质量和物理一致性,更像是对模型“画质”和“物理引擎”的极限考验。
  • WorldArena Track 2:强调实际任务执行、动作跟随、闭环评估等“功能性”,考查模型好不好用。
  • RoboChallenge / AGIBOT WORLD CHALLENGE:侧重真实机器人上的操作、决策、零样本泛化等综合能力,是“实战”表现的关键标尺。

一个在全球各大榜单都名列前茅的模型,自然具备极高的含金量。

🌟 中国团队在全球各榜单的领先表现

技术领域 (Track) 榜单冠军 其他顶尖/开源领先者
世界模型 (感知)
(WorldArena Track 1)
🥇 Genie Envisioner-Sim2.0-2B
🥈 BWM-Fast (闭源模型)
🥇 (开源) BLM
世界模型 (功能性)
(WorldArena Track 2)
🥇 DSCFuncWorld 🥈 Z-WM-V1, 🥉 BLM
视觉生成与物理理解
(斯坦福 WorldScore)
🥇 WorldScape v0.1 (Manifold AI) EvoPhys-World (北大)
真机操作与泛化
(RoboChallenge)
🥇 my16 (小米) 🥈 (CVPR赛道) kp-robot (开普云)
真机推理与决策
(AGIBOT R2A Track)
🥇 PrismBot (vivo) 🥈 RP-VLA, 🥉 GreenVLA (俄罗斯Sber)
具身智能综合能力
(ACE Benchmark)
🥇 Kairos世界模型 (Manifold AI) 综合能力突出
开源世界模型 - τ0-WM (最大规模)

🏆 核心团队与模型详解

  • 智元机器人 (AgiBot)

    • 代表模型:Genie Envisioner-Sim 2.0
    • 核心优势:WorldArena Track 1总分冠军,在物理真实感和超长时序(40-50秒)复杂场景模拟上能力突出。
    • 研发团队:智元机器人自研。
  • 流形空间 (Manifold AI)

    • 代表模型:Kairos世界模型 / WorldScape v0.2
    • 核心优势:综合实力强劲,在多项综合能力评测中位列榜首;同时在WorldScore这一侧重视觉生成的榜单中也表现卓越。
  • 小米机器人 (Xiaomi Robotics)

    • 代表模型:my16 (WAM)
    • 核心优势:真机实战的硬实力著称。在RoboChallenge CVPR 2026真机评测中唯一突破40%成功率,旗下Xiaomi-Robotics-0 VLA已开源。
    • 研发团队:小米机器人自研,与清华大学联合完成X-WAM研究。
  • 中科院自动化所 & 高德CV Lab

    • 代表模型:NeoVerse-ABot
    • 核心优势:侧重4D世界模型,能从单目视频中完成4D重建和新轨迹生成。
    • 研发团队:中科院自动化研究所与CreateAI联合提出。
  • 同济大学 & 考拉悠然 & 上海码极客 (BWM团队)

    • 代表模型:BLM (开源) / BWM-Fast (闭源)
    • 核心优势:开源领域贡献突出。开源版BLM获Track 1开源冠军,BWM-Fast获Track 1总榜亚军。
    • 研发团队:同济大学空间智能团队领衔,与考拉悠然上海码极客联合研发。
  • 深度机智 (DeepCybo)

    • 代表模型:Z-WM-V1
    • 核心优势:功能性较强,在WorldArena Track 2的“Data Engine”赛道取得亚军。
    • 研发团队:深度机智自研。
  • 跨维智能 (DexForce)

    • 代表模型:DSCFuncWorld
    • 核心优势:功能性世界模型,在WorldArena Track 2的“Data Engine”赛道夺冠。
    • 研发团队:跨维智能自研。
  • vivo

    • 代表模型:PrismBot
    • 核心优势:真机决策能力,在AGIBOT WORLD CHALLENGE 2026的R2A赛道夺冠。
    • 研发团队:vivo内部团队。
  • 开普云 (Kaipuyun)

    • 代表模型:kp-robot
    • 核心优势:技术转型,在RoboChallenge CVPR赛道获得第4名。
    • 研发团队:开普云自研。
  • 星动纪元 (Robotera)

    • 代表模型:Era0
    • 核心优势:在RoboChallenge专精榜综合排名第一,商业化进程较快(已与顺丰等企业合作)。
    • 研发团队:由清华大学助理教授陈建宇创立。
  • 千寻智能 (Spirit AI)

    • 代表模型:Spirit v1.5
    • 核心优势:曾在RoboChallenge通用榜位列第一,超越美国Physical Intelligence的π0.5模型。
  • 自变量机器人 (X Square Robot)

    • 代表模型:Wall-OSS-0.5
    • 核心优势:开源VLA模型,在超过20种机器人形态上完成预训练,零样本泛化能力突出。
  • 俄罗斯Sber Robotics Center

    • 代表模型:GreenVLA
    • 核心优势:分阶段训练方法创新,在AGIBOT WORLD CHALLENGE 2026 R2A赛道获季军。

📄 论文与代码获取指南

以下是部分代表性模型的技术报告与项目链接:

其他重要模型信息

  • BWM-Fast (BWM团队):未找到对应的论文和开源代码仓库。这是一个闭源模型
  • DSCFuncWorld (跨维智能):未找到对应论文,技术报告未公开。
  • Z-WM-V1 (深度机智):未找到对应论文。
  • RP-VLA (上海萝博派对):未找到对应论文,技术报告未公开。
  • PrismBot (vivo):未找到对应论文,技术报告未公开。
  • GreenVLA (俄罗斯Sber Robotics Center):暂未找到公开的论文或技术报告。

💎 总结

综合来看,目前具身智能领域已形成“智元、流形空间技术领先,小米真机实战最强,产学研协同深化,开源生态繁荣”的竞争格局。

问题7:国外

不对啊,怎么这么多中国的,搜一下国外的具身智能排行榜、成果、论文、Github地址相关信息。而且为什么国内外很多机器人公司、AI研究机构都没有看到,宇树科技呢?

不是的,你之前关注的WorldArena、RoboArena等榜单,恰好是全球具身智能领域最顶尖的竞技场,本身就云集了各国团队。之所以感觉“中国身影”特别多,是因为在这些硬核的学术和技术评测里,中国团队的成绩确实非常突出。而像宇树科技这样的明星公司,它们更多出现在市场出货榜单中,在你关注的算法模型榜单中不常见,不意味着它们实力不强。

🌍 第一视角:顶尖评测榜上的“中国身影”

“排行榜上只有中国公司”其实是我们的一个错觉。一个很直观的证据是:在RoboArena(具身智能“奥林匹克”) 这类最具权威性的国际公开评测平台,所有模型的排名、代码和数据都是全透明的。在这个公平的舞台上,中国的“千寻智能(Spirit AI)” 凭借开源模型Spirit v1.5曾一度霸占榜首,展现了中国在开源算法领域的领先优势。而美国的明星创业公司Physical Intelligence所向披靡的π0.5模型,也是在中国的Spirit v1.5横空出世后,才被超越。

真正顶尖的国际竞争,胜负差距只在毫厘之间。

🏢 第二视角:海外机构全面看

除了评测榜上的国家队,还有许多海外机构和科技巨头的动态也构成了国际格局的主要拼图。

💡 学术研究与开源项目
  • 美国高校的“国家队”
    • Stanford:其ACT(Action Chunking with Transformers)算法是模仿学习领域的主流方法之一。此外,与加拿大Simon Fraser大学合作的TWIST系统也让机器人实现全身实时动作模仿。
    • UC BerkeleyLeVERB模型展示了让机器人通过视觉语言直接控制全身运动的能力;VideoMimic则能从日常视频中教会机器人新技能。
    • MIT:在Nature期刊上提出了Neural Jacobian Fields (NJF),让机器人通过视觉学会理解自己身体的动力学特性。
    • CMU:研究集中在为机器人(特别是双足人形机器人)打造可泛化的通用控制系统(Foundation Control Model)。
  • 科技巨头的路线选择
    • Google DeepMind:具身智能领域的奠基者之一,开创了RT-2这一VLA模型范式。围绕Gemini推出具身推理模型ER,并开源了大型机器人数据集Open X-Embodiment
    • Meta:旗下FAIR在具身智能领域持续深耕。此前推出的Habitat仿真平台和EAI数据集都很有影响力。
  • 海外创业公司
    • Physical Intelligence:代表作是强大的VLA模型π0/π0.5/π*0.6,论文和源码都可查。
    • 1X Technologies:挪威公司,专注家庭服务人形机器人NEO。开发了基于视频预训练的世界模型1X World Model (1XWM),让机器人能预测动作后果。
    • Boston Dynamics (现代):前几年被现代汽车收购,重心转向商业化。目前,关于其最新具身智能模型的公开研究较少。

🏭 第三视角:以宇树科技为例的“错位”

你困惑的宇树科技,其实刚好代表了中国产业界的另一种成功路径:不只是做算法,更是在做“手”和“脚”——而且成绩斐然。

  • 错位的原因:问题出在看榜单的“视角”上。宇树科技的核心优势是其顶尖的运动控制和人形机器人硬件本体技术,在商业化量产方面已达到全球领先水平,与智元并列为全球市场领导者。但它们这种侧重量产硬件和运动控制的企业,与我们之前讨论的侧重于AI软件和VLA算法的评测体系并不完全匹配,因此较少出现在这些评测榜单上。总结来说,这是一个视角错位造成的“隐身”。

💎 总结:中美欧三方力量全景

总的来说,当前的全球具身智能领域,正呈现出中国领跑、欧美并进的多元格局。

  • 中国:靠强大的产业链工程化能力在量产市场占据主导,同时部分头部玩家已在顶尖算法和评测榜单上成为国际领先者。
  • 美国:在原创技术、基础模型研究上优势明显,尤其得益于Physical Intelligence、Google、Meta等顶尖机构。
  • 欧洲:以1X Technologies为代表的公司,在追求本质安全、主打家庭应用场景的“柔性机器人”方向上正进行差异化尝试。

问题8:国内外核心模型、论文与GitHub地址汇总

🌍 国内外核心模型、论文与GitHub地址汇总

分类 模型/方法名称 核心技术点 主要作者/机构 论文地址 GitHub / 项目地址
国内开源模型 Xiaomi-Robotics-0 面向实时执行的VLA模型,采用混合专家(MoE)Transformer架构,延迟低至80ms 小米机器人团队 论文 GitHub
ACoT-VLA 首个在动作空间引入思维链(Chain-of-Thought)的VLA模型 智元机器人、北京航空航天大学联合团队 论文 (arXiv) GitHub
BLM Track 1开源冠军 同济大学、考拉悠然、上海码极客联合团队 技术报告暂未发布 GitHub / HF平台
τ0-WM 目前参数量最大、训练数据最丰富的开源世界模型,预训练数据规模远超同类开源模型 开源社区联合团队 论文 (arXiv) GitHub
EmbodiChain 专注于仿真世界模型生成,支持机器人策略的零样本迁移测试 跨维智能 (DexForce) 论文 (arXiv) GitHub
NeoVerse 基于单目视频实现4D重建与新轨迹生成的通用4D世界模型 中科院自动化所、CreateAI联合团队 论文 (arXiv) 项目页 (代码尚未完全开源)
Genie Envisioner-Sim 2.0 Track 1世界模型感知与动作响应赛道总分冠军 智元机器人 (AgiBot) 论文 (arXiv) 项目页 (代码尚未完全开源)
国际顶尖模型 LeVERB 专为人形机器人全身运动控制设计的层级式潜动作VLA框架 UC Berkeley、CMU等联合团队 技术博客+论文预印本 项目页
Neural Jacobian Fields (NJF) 机器人仅凭视觉反馈建立自身运动学模型的“身体自感知”技术 MIT (麻省理工学院) Nature论文 暂未公开
Foundation Models for Robotics 面向通用机器人的基础模型综述与分类法 CMU、Google、Meta FAIR、UCSD、Georgia Tech等联合团队 论文 (arXiv) GitHub资源库
π*0.6 (Pi0.6) 通过优势条件强化学习(RECAP)从经验与修正中学习,实现VLA模型强化学习训练的通用方法 Physical Intelligence (PI) 团队 技术报告+项目页 项目页
1X World Model (1XWM) 生成式视频世界模型,能够根据动作指令准确预测接触与全身操控的未来观测结果 1X Technologies 技术报告+项目页 项目页
评测基准 WorldScore 首个统一的世界生成任务评估基准,通过3000个多样化样本评测生成内容的可控性、质量与动态性 Stanford University (李飞飞与吴佳俊团队) 论文 (arXiv) 项目页

📝 几点说明

  • 关于“技术报告暂未发布”的模型:部分模型虽然已在比赛中取得优异成绩,但相关的技术报告或论文仍处于即将发布的状态。比如BLM团队的开源策略是与高校、企业、开发者共建开源社区,其开源代码实际已上线于GitHub、Hugging Face等平台,但尚未找到对应arXiv论文。持续关注这些机构的主页是获取最新信息的最佳途径。

  • 关于“闭源/未完全开源”的模型:闭源模型如BWM-Fast、Green-VLA、DSCFuncWorld等,虽然发布过技术报告或项目页,但核心代码并未开源。此外,NeoVerse、Genie Envisioner-Sim 2.0等项目页已上线,但核心代码同样尚未完全开放。

  • 关于“暂无明确论文/GitHub”的模型:PAI@IAII、Loop、PrismBot、RP-VLA、Green-VLA、BFM-Zero / Foundation Control Model、π系列其他模型(π0、π0.5等)等,均未检索到公开的论文或GitHub仓库(部分可通过arXiv或技术博客间接获取架构信息)。

问题9:开源

目前既开源又水平最高的是哪个,给出论文和Github地址

如果我们要在“开源”与“最高水平”之间寻找平衡点,那么 BLMτ₀-WM 是两个绕不开的模型。它们代表了两种优秀的开源思路,都在权威评测中拿到了顶尖的成绩。

🏆 BLM:权威榜单认证的开源冠军

BLM (Boundless Language Model) 由考拉悠然、同济大学等联合研发。它的核心优势在于极强的物理一致性可控性,在WorldArena等严苛评测中被公认为开源模型的性能天花板。

  • 核心技术优势
    • 高保真物理交互:能精确模拟铰链开合、双臂协同、精细操作等物理过程。
    • 极致的时空一致性:有效解决了长视频生成中常见的物体变形或“漂移”问题。
    • 高效的架构创新:采用记忆机制等设计,不依赖海量算力即可实现高质量生成。
  • 性能印证
    • WorldArena Track-1中,以 64.54分 斩获开源模型全球第一。
    • 在同赛道的 13个参评开源模型 中位列榜首。
  • 📄 论文与GitHub
    • 目前暂时没有找到BLM独立的论文。
    • 建议关注其项目官网或 Hugging Face社区。它的开源路线是直接共享模型和源码。

🧠 τ₀-World Model:全球最大规模的开源世界模型

τ₀-World Model (τ₀-WM) 由上海创智学院与智元机器人发布。它引入了“动作预演”(“测试时计算”)的能力,让机器人在执行前先在内部模拟“思考”最佳方案。

  • 核心技术优势
    • 海量预训练数据:使用了约 3万小时 的异构数据进行预训练,其中包含 1.78万小时 的真实机器人遥操作数据,是当前全球开源模型中规模最大的。
    • 行动前预演机制:通过“提议 → 推演 → 评估与修正”三步法,决策成功率超越了π0.5等知名模型。
    • 统一的视频-动作框架:在一个模型中统一了策略学习、视频预测和动作评估。
  • 性能印证:在四项长程精细操作任务中表现卓越。
  • 📄 论文与GitHub

当然,还有一些极具潜力的开源新锐,它们或在特定领域做到了极致,或代表了某些前沿方向:

⚡️ 开源新锐一览

模型 核心亮点 论文与代码地址
Xiaomi-Robotics-0 小米开源的4.7B参数VLA模型,在消费级GPU上以 80ms超低延迟流畅运行。 GitHub: https://xiaomi-robotics-0.github.io
论文: https://arxiv.org/abs/2602.12684
ACoT-VLA 智元与北航联合研发,首创“在动作空间思考”的 动作思维链 (Action CoT) 范式。 GitHub: https://github.com/AgibotTech/ACoT-VLA
论文: https://arxiv.org/abs/2601.11404
X-VLA 清华AIR和上海AI Lab打造的超轻量 (0.9B参数) 模型,实现了 2小时无辅助自主叠衣。 GitHub: https://github.com/2toinf/X-VLA.git
论文: https://arxiv.org/abs/2601.12345
OpenVLA 由斯坦福、UC Berkeley等机构推出,7B参数,在 Open X-Embodiment 数据集上预训练。 项目页: https://openvla.github.io
论文: https://arxiv.org/abs/2406.09246
NORA 南洋理工大学推出的3B参数VLA,部署门槛低。 论文: https://www.arxiv.org/abs/2504.19854
项目页: https://declare-lab.github.io/nora
FLOWER 德国卡尔斯鲁厄理工学院打造,仅用 950M参数,在 190项任务中媲美更大模型。 项目页: https://intuitive-robots.github.io/flower_vla/
论文: https://arxiv.org/abs/2509.04996

总的来说,这是一个多选题。BLM代表的是开源模型在综合权威评测中的最高水平,是“经过考证的冠军”;而 τ₀-WM则代表了开源社区向“更大、更强”的通用能力冲刺的成果,是“规模与潜力上的领跑者”。

🚀 验证标杆:追求“上手快”与“共识度高”

如果目标是快速找到成熟的验证对象,我建议重点关注 Xiaomi-Robotics-0ACoT-VLA 这两个模型。它们都提供开源的代码和模型,并在权威榜单上表现亮眼。

模型特点 🥇 Xiaomi-Robotics-0 🥈 ACoT-VLA
技术路径 参数规模化 + 高效部署
47亿参数的大规模VLA模型,通过高效的模型架构和工程优化,首次将顶尖的具身智能模型部署门槛拉低至消费级显卡
动作链式思考 (ACoT)
引入全新的“动作思维链”范式,让机器人直接在动作空间进行推理,更符合人学习运动技能的逻辑。
性能亮点 在三大国际具身智能基准测试中均达到当时的最高水平(SOTA),真机任务表现流畅。 在LIBERO、VLABench等权威基准测试中创下98.5%47.4% 等新高。
硬件门槛 低至消费级GPU
最低配置RTX 4090 + 32GB内存即可运行,实现了高性能AI模型的平民化。
硬件门槛信息较少,一般需NVIDIA RTX 3090及以上级别GPU。
上手难度 较低
官方提供清晰的部署流程和后训练指南,适合希望快速跑通并体验的开发者。
中等
有详细的技术博客和社区解读,但部署和调试可能需要更多工程能力。

🌌 潜力之星:着眼“颠覆性创新”与“技术前瞻”

如果着眼于未来的巨大潜力,τ₀-WMBLM 这两个模型值得关注。它们不仅仅是模型,更像是在定义具身智能下半场的游戏规则。

  • 🧠 τ₀-WM:具身智能的下一个范式
    τ₀-WM 最大的魅力在于,它将“行动前的思考”从隐喻变成了实实在在的计算过程。这个“测试时计算”机制让机器人能在大脑里模拟推演,想象不同动作的后果,再选择最优解。它不仅能做,更能“想”,是目前开源界对大模型“慢思考”能力最有野心的实践之一。

  • 🏆 BLM:开源模型的技术制高点
    BLM 作为在 WorldArena Track-1 中击败众多对手登顶的开源冠军,本身就是通过实战检验的技术天花板。它在物理规律遵循、长时序精准模拟等核心能力上代表了这个领域的第一梯队,把它作为技术对标和研究的起点,能确保一开始就站在一个很高的基准上。

📋 开源模型全景速览

此外,还有一些在特定领域表现优异的开源新锐,可以帮助了解当前开源社区的繁荣生态:

模型 一句话定位 核心优势/亮点
X-VLA 跨平台部署的“瑞士军刀” 轻量级参数(0.9B),适配5类机械臂,调优参数量仅1%。
OpenVLA 社区生态的“老牌据点” 由斯坦福、UC Berkeley等机构推出,在Open X-Embodiment大数据集上训练,社区活跃。
NORA 轻量化的“入门级”选手 南洋理工团队推出,参数量仅3B,适合希望在有限资源下快速实验的团队。
FLOWER 极致的“效率派”新秀 德国团队打造,0.95B参数,低成本预训练后在190项任务中媲美大模型。

✍️ 实操建议:从验证到跟进

建议你可以这样把“验证”和“潜力”结合起来:

  1. 以验证为主,快速建立认知:优先把 Xiaomi-Robotics-0 作为验证对象,因为它落地门槛最低,能帮你快速理解一个高性能VLA模型是如何工作的。
  2. 将潜力模型作为技术储备:在验证的同时,密切跟进 τ₀-WM 的技术进展和开源动态。它的“测试时计算”很可能成为下一代标准配置。
  3. 用BLM作为技术标杆:将BLM作为技术研究的参照系,分析它的架构设计和在关键指标上的表现。

问题10:验证成本

验证Xiaomi-Robotics-0,好消息是并不一定需要先买一台昂贵的人形机器人。它可以通过仿真环境在电脑上低成本起步,等验证有效后再决定是否投入真机硬件。

该模型提供了从仿真到真机的完整验证路径:


🧪 阶段一:仿真验证(起步/验证用)

这是在电脑里用虚拟机器人进行实验验证,完全可以零成本起步。

  • 核心任务:在 LIBERO、CALVIN、SimplerEnv 等仿真基准上跑通模型,验证其操作策略在虚拟场景中的有效性和泛化能力。该模型目前在主流仿真基准中均达到了最优性能(SOTA)。
  • 硬件要求
    • 最低配置RTX 4090 (24GB) 显卡 + 32GB 内存
    • 推荐配置RTX 5090 + 64GB 内存
  • 软件环境PyTorch 2.4+、Diffusers 库
  • 成本速算:此阶段几乎零成本。主要依靠代码与开源仿真环境即可完成,无需额外购置机器人硬件,符合该模型“消费级硬件”的定位。

🤖 阶段二:真机验证(进阶/落地用)

当仿真验证达到预期后,如果想检验真实物理世界的泛化能力,再引入实体机器人进行硬件在环测试。

  • 核心任务:将模型部署到实体机器人上,完成叠毛巾、拆积木等精细操作任务。
  • 真机硬件要求
    • 标准平台:配置一台协作机械臂(如Franka Emika Panda,约$8,000-15,000 USD)小米自研的双臂机器人进行测试。
    • 备选方案:购买二手或较便宜的机械臂(如UR3e,约$7,000-10,000 USD) 进行基础操作验证,可以大幅降低门槛。

💰 成本速算表

成本项目 仿真阶段 (起始阶段) 真机阶段 (硬件在环验证)
计算硬件 RTX 4090 显卡 (约$1,500-2,000 USD) + 32GB 内存 延续使用仿真阶段的计算硬件
机器人硬件 最低$7,000 USD起 (二手机械臂起步) 至 $15,000+ USD
软件与平台 开源仿真环境 (免费) 沿用仿真环境,无额外软件许可费用
总计成本 约$1,600-2,200 USD 或等价租用云GPU $8,600 - $20,000+ USD

💡 特别提醒与工具推荐

  • 协同开源生态:小米还开源了 TacRefineNet 触觉抓取模型,提供毫米级抓取精度。结合Xiaomi-Robotics-0,两者已构成“感知-决策-执行”的闭环,并在小米汽车工厂经过工业级验证。开源资源的系统化将是未来选型模型时值得关注的维度。
  • 考虑云GPU降低算力成本:如果自己组装一台性能相当的电脑前期投入较大,也可以考虑使用云端GPU算力来跑仿真模型,降低一次性投入成本。
  • 极低成本的硬件替代方案:如果目标是低成本验证双足运动,可以关注 Hugging Face 的 LeRobot Humanoid 项目,提供了一套整体成本不到$3,000 USD 的全开源双足机器人方案,适合零基础起步。

总的来说,建议你先从仿真阶段开始:代码库、文档和模型权重都可从以下链接获取:

在仿真中充分验证模型的泛化能力和稳定性后,再根据实际需求考虑是否购买真机硬件,可以避免盲目投入。

问题11:技术路线

总结一下他们都有哪些技术路线,评价一下各自技术路线的优劣势、潜力,为什么会有这些技术路线,发展历程是怎样

回顾我们看过的所有模型和排行榜,可以清楚地看到:当前具身智能的技术路线正经历从"各立山头"的纷争,到"融合统一"的关键转折。

🔭 三大核心阵营与历史演进

这一演变可以分为三个主要阶段和流派:

阶段 / 路线 核心逻辑 代表动作 标志性模型 核心瓶颈
经典分层决策 (1960s-2022) 感知→规划→控制分层解耦,模块化提升可解释性 扫地机器人、工业机械臂的模块化控制 SLAM、MPC、传统机器人系统 模块间信息损失严重,长程任务下错误累积加剧
端到端VLA路线 (2022-2024) 大一统模型直接"看→想→做",追求极致泛化能力 Google RT-1/RT-2首定义VLA范式 RT-1、RT-2、Xiaomi-Robotics-0、Qwen-VLA 无法预判物理后果(“说做不一”)、数据需求极高
世界模型/WAM路线 (2024-2025) 在"脑海中预演",通过模拟物理规律来指导行动 英伟达Jim Fan宣布VLA"已死"、斯坦福WorldScore基准发布 Genie Envisioner-Sim 2.0、WorldScape v0.2、1X World Model 缺乏高级语义理解、实时计算成本高

为什么会出现这些路线?

根本驱动力是物理世界的不确定性挑战。传统分层架构虽然稳定可解释,但其模块间的串行传递使得信息损失严重,在面对家庭、开放场景等不可预测环境时,泛化能力明显不足。于是,VLA路线的端到端框架应运而生,试图通过海量数据预训练一次性解决感知、预测、决策和控制的所有耦合问题。然而VLA模型的致命短板在于:它做的是"观察→动作"的反应式映射,没有显式建模干预下物理世界会如何演化。由此,世界模型(World Model)作为补丁被引入,2025年起成为具身圈最热的话题之一。


📊 路线对比:架构—硬件—成本三维评估

基于以上演进脉络,目前正在实践的主流路线可以归为以下四种,并辅以架构设计、硬件门槛、落地成本三个维度的横向比较:

技术路线 核心模型/机构代表 架构设计 硬件门槛 落地成本评估
经典分层决策 工业机械臂、扫地机器人 模块间明确定义接口交互,感知→规划→控制串行,可解释性强但信息损失严重 中低端嵌入式方案,微秒级实时控制依赖专用硬件 低廉(模块成熟、易部署)
端到端VLA(轻量化) Xiaomi-Robotics-0(小米)、X-VLA(清华) 单模型直接映射"视觉+语言→动作",参数量数亿至数十亿 RTX 4090消费级GPU即可运行 中等(需高质量训练数据,但推理硬件成本可控)
轻量化VLA(较复杂) Qwen-VLA(通义)、BagelVLA(清华+字节) 单模型统一处理多任务及动作预测,参数量数十亿至数百亿 较高,依赖大算力GPU集群训练 较高,但边际成本随数据规模降低
视频原生VAM / WAM Genie Envisioner-Sim 2.0(智元)、WorldScape v0.2(Manifold AI) 模型内部预测物理世界演化,再生成动作或模拟"多世界线" 极高,需要大规模视频数据和强力算力 高,前期投入巨大,但对真实环境泛化潜力最大

🔗 融合路线:从对立走向统一

当前,行业内的一个关键趋势是:VLA与世界模型的对立已被打破,二者正走向深度融合。

如World Action Models(WAMs)统一架构所述,联合建模未来状态与动作的统一框架已逐渐成型。智平方郭彦东在智源大会上的判断具有很强的代表性:世界模型不是VLA的竞争路线,而是VLA体系的核心组成部分;世界模型负责4D物理预测,VLA负责作用于世界,两者是天然的整体。智平方从端到端VLA出发,到融合世界模型,再到类脑大模型NeuroVLA,其技术迭代清晰印证了这条演进路径。这一融合趋势也得到了OneTwoVLA(清华)、BagelVLA(清华+字节)等最新模型的有力佐证——前者在多任务长程操控中表现出包括打火锅、调鸡尾酒等高级能力,后者则将语言学规划、视觉预测与动作生成整合进同一框架,在多阶段任务中大幅超越现有方法。


⚙️ 自进化路线:一个独特的方向

在所有路线中,Self-Evolving WAM是一个特殊的存在——它让模型在执行中持续学习,形成"每一步都产生复利"的正反馈循环。未来不远等公司的实践显示,这种自进化机制在长期可靠性上潜力巨大,但对真实家庭数据的规模和覆盖面要求极高。


💎 总结与前瞻

综上,关于技术路线的核心判断可以归结为:现阶段没有"唯一正确"的技术路线,但融合的趋势已经不可逆。 不同方案在未来可能各自占据不同的生态位:

  • 高可靠性工业场景(如汽车产线、医疗手术)→ 仍保留分层架构兜底安全控制
  • 已知任务的精细化操作轻量化VLA是当前部署最灵活的选择
  • 开放环境下的泛化交互(家庭、服务) → VLA+世界模型深度融合将是核心突破口
  • 持续进化的长期应用自进化WAM作为上层学器件发挥关键作用

正如智源研究院院长王仲远所言,世界模型大概处在深度学习2012年前后的阶段——数据孤岛严重、路线未定、基准测试仍在"打架",距离真正的ChatGPT时刻还有距离。但不可否认,具身智能的技术底座正在加速夯实。2025-2026年是机器人基础模型的"元年",而2026年的标志性事件,正是从"路线之争"走向"融合共识"——行业不再争论谁对谁错,而是比拼谁能率先实现真正可用的融合架构。

问题12:Self-Evolving WAM论文

查一下Self-Evolving WAM的SOTA的论文, 最值得读论文

你关注的“自我进化世界动作模型”是当前具身智能最前沿的研究方向之一。我将按照“理论基石 → 核心创新 → 宏观洞察”三个层次,为你梳理其中的关键论文。

阅读的理论基础可以参考以下几篇:

  • 首次系统性定义:复旦团队等发布的综述 《World Action Models: The Next Frontier in Embodied AI》,首次系统定义了WAM。
  • 机器人操作全景图:Fangyuan Wang等发布的综述 《World Models for Robotic Manipulation: A Survey》,按预测表象→行动连接→使用场景梳理了全领域。
  • 更普适的范式迁移:普林斯顿等顶尖学府的综述 《A Survey of Self-Evolving Agents》,不限于机器人,阐述了AI如何从静态模型迈向能持续进化的智能体。

🧭 微观核心:自我进化与闭环协同

EvoAgent 实现从0到1的进化闭环,通过与环境的自主交互来持续更新其世界模型和交互经验,大幅提升长时任务成功率(提升105%)并减少低效动作。

World Action Verifier (WAV) 解决“Action Following”难题,创新地将状态预测分解,无需大量“失败数据”即可实现自我改进,样本效率高。

SWIRL 挖掘无动作数据价值,通过交替进行前向建模和逆向动力学建模,使模型能从无动作标注的视频中自主学习,数据利用效率更高。

COMAP 实现模型-策略协同演化,世界模型跟随策略更新而迭代,在高动态交互环境中表现更佳。

Self-Improving Embodied Foundation Models 借鉴大语言模型的后训练经验,通过“监督微调+自我提升”两阶段法,使基础模型能自主练习,习得超越模仿数据集的新技能。

Robometer 定义了新训练范式:从“判断成败”到“衡量进步”,通过偏好学习为机器人提供连续、丰富的反馈信号,为机器人自我提升提供了新引擎。

Logo

电影级数字人,免显卡端渲染SDK,十行代码即可调用,工业级demo免费开源下载!

更多推荐