具身智能行业正站在一个尴尬的分水岭上。一边是发布会上行云流水的Demo,一边是落地真实场景的重重挑战。

这种割裂,终于被一座“珠峰”捅破了。

2026年7月,由香港大学多媒体实验室联合加州大学伯克利分校、清华大学等全球近20所顶尖学术机构共同推出的具身智能评测基准RoboDojo正式亮相。它被业界称为具身智能的 “珠峰级”考试。42个仿真任务、18个真实机器人任务,30个主流策略同台竞技,覆盖泛化、记忆、精细操作、长程执行、开放语义理解五大能力维度。

仿真与真实世界双榜机制,统一硬件、统一光照、统一复位流程、双盲打分,RoboDojo让评测不再是各自讲故事的“开卷考”,而是一场标准化的全科闭卷考试。

更扎心的是,成绩单让整个行业沉默了:在仿真环境中,当前表现最佳的通用机器人策略平均成功率仅为8.80%;真机环境,这一数字是12.8%。而人类专家在同样任务上的表现是:仿真76.03%,真实世界100%。

就在这份让全行业集体焦虑的榜单上,一家中国公司给出了不一样的答案。近日,原力灵机(Dexmal)通用具身基础模型DM0.5以综合得分24.90、平均成功率19.34%的成绩登顶RoboDojo仿真榜首位。

图片

而且在 Memory 维度上,DM0.5取得了 47.74 分和 47.44% 的成功率,实现断崖式领先。

比排名更重要的是,这份成绩单向行业传递了几个信号:

第一,这种"人类满分、AI 仍在山脚"的巨大鸿沟,残酷地揭示了一个行业现实:我们离真正的通用具身智能,还很远。

第二,具身智能的竞争维度正在被重新定义。不再靠单项指标,而是一个由记忆、推理、控制、效率和跨本体泛化共同构成的系统工程。

第三,通往真实世界的路,不是从“更炫的Demo”开始,而可能从“更长的记忆”开始。

图片

图片

DM0.5凭什么赢?

记忆能力成关键

RoboDojo的成绩单里藏着一个容易被忽略的细节。

仿真榜单上,DM0.5综合得分24.90,第二名20.23,领先但算不上碾压。但在Memory这个单项,DM0.5拿下了47.74分和47.44%的成功率,而第二名只有13.37分和12.11%。

这恰恰击中了具身智能行业一个长期被低估的瓶颈:记忆。

过去几年,行业聚焦在“如何让机器人更聪明”上:更强大的世界模型、更精细的控制算法、更高自由度的硬件。但一个问题被忽视了:如果机器人“走一步忘一步”,无法记住自己此前做过的所有动作序列,那么再精准的单步动作,也无法支撑起一个真正自主的长程任务。

行业已经开始直面记忆这块短板。Physical Intelligence团队在2026年3月发布的MEM研究中指出,随着单项动作技能逐渐成熟,新的瓶颈转向它能否调用这些技能完成复杂任务。长时和短时记忆由此成为完成真实世界任务的核心要求。

RoboDojo的记忆任务设计就是针对这一瓶颈而来。机器人需要记住传送带上曾经出现又消失的物体,再从后续候选物中选出匹配目标。

此前,原力灵机参与完成的MemoryVLA论文提出将工作记忆与感知—认知记忆库相结合,以加强VLA对历史信息和时间依赖的建模,并被ICLR 2026接收。此后,该论文先后被Physical Intelligence的两篇论文引用。

这说明,原力灵机对具身记忆的探索已经进入国际头部团队的技术讨论。DM0.5此次在Memory维度断层领先,也并非一次针对榜单的临时优化,而是此前技术实力的展现。

实现原生支持最长60秒的长时记忆,DM0.5做对了什么?它在预训练阶段就把记忆能力当作核心能力来训练,而非事后补丁。

这种差距在具体任务中体现得尤为明显。Cover Blocks任务就是一块试金石:机器人要先从左到右盖住随机排列的红、绿、蓝三个积木;当颜色被完全遮挡后,机器人必须依靠此前的观测记住每种颜色的位置,再按红、绿、蓝的顺序依次揭开。

DM0.5在三次随机测试中全部拿下100%成功率。这证明其记忆能力不是凭运气,而是已经做到了“稳定可用”。

原生长时记忆解锁的远不止刷榜能力。它让两件过去做不到的事情变成了可能:

第一,长程任务的连贯执行。 

没有记忆的机器人就像一个失忆的清洁工,把东西收进柜子,转头就忘了它们原来在哪。DM0.5的60秒记忆让机器人能够“记得来处”,在处理多步骤收纳时保持时序逻辑连续不中断。

第二,人类示教的“看一眼就会”。 

基于长记忆特性,模型可以直接跨越语言限制,理解人类演示的视频片段。过去教会机器人一个新动作需要采集大量数据;现在,人类做一遍,机器人看完就能跟着做。

记忆能力不是锦上添花,是具身智能从“遥控玩具”走向“自主工人”的底层能力。 没有记忆,就没有对任务上下文的理解;没有理解,就谈不上真正的自主决策。

而DM0.5的突破恰恰说明:行业到了该认真解决记忆问题的时候了。

图片

DM0.5不是“偏科生”,

而是一个全科优秀选手

RoboDojo考的是五门课,但DM0.5并不是靠单科满分拉高总分的“偏科生”,而是一个各科都在前列的“全能选手”。

多份榜单验证了这一点。在LIBERO上,DM0.5综合成功率达到99.0%;在RoboTwin 2.0中,简单和复杂场景下成功率分别达到93.6%和93.3%;在RoboChallenge Table30 V2真机评测中,面对ARX5、UR5、ALOHA、Dexmal-Mirror四种异构机型、30个复杂任务,DM0.5以43.0%的整体成功率和54.42的综合得分位列第一。

图片

这种“全科优秀”在具体能力上体现得更直观。

抗干扰能力最考验模型的真功夫。真实场景里,光照会变、视角会动、人可能会中途插手。

DM0.5在相机视角剧烈变化下仍能稳定执行任务,在被人类动作强行打断后,能自主感知当前状态并修正后续动作。这套能力背后是“双系统大脑”架构:高阶大脑负责理解大局与预判,直觉反射网络负责高频响应,一个动脑一个动手,分工明确。

亚毫米级精细操作也是DM0.5的差异化竞争优势之一。

微型积木拼装中,最小的组件宽度不到1厘米,机器人要在0.1到1毫米的尺度内完成抓取和扣合——这个精度已经超越了人手约0.3到1毫米的自然抖动极限。DM0.5不仅做到了,还展现出了“自动纠错”能力:积木拼歪了,它能自主感知、调整姿态、重新按压。平均每12秒完成一次拼装,可全天候不间断运行。

对于削黄瓜这类需要柔性精细力控的场景,DM0.5并非依赖视觉捕捉或预设轨迹,而是通过关节电机电流值实时感知末端作用力,在动作执行过程中动态调节力道大小,实现对接触力的精准控制。

切黄瓜则进一步考验机器人的灵巧手精细操作能力。带有高自由度灵巧手的人形机器人完成58个自由度的协同控制,既要保证刀法精准,又要控制力道不把黄瓜切碎。

图片

长程稳定高节拍则是在真实物流中转站的单件分离场景:堆叠的包裹必须逐一分离,传送带不停,每个包裹尺寸、材质、摆放姿态都不一样,机器人只有几秒钟反应时间。DM0.5不依赖预设脚本,纯靠实时视觉识别和决策,平均3秒一单,准确率超99%。

图片

DM0.5把这些能力融合在一起,恰恰呼应了行业正在发生的一个深层变化。

赛迪研究院在2026年8月发布的《具身智能技术与产业发展报告》中明确指出:全球具身智能竞争已从比拼单机演示效果,转向模型、数据、本体、仿真、评测、交付全链条体系能力的比拼。

换句话说,行业已经过了“做一个漂亮的Demo就能拿融资”的阶段。而DM0.5登顶RoboDojo的意义正在于此:它证明了“通用”不是口号,而是可以在标准化测试中被量化的能力。

图片

拆解成绩单:

数据、架构、效率全面升级

DM0.5成绩背后是一场围绕数据、架构、效率三个层面的系统升级。任何一个掉链子,都撑不起“全科优秀”的成绩单。

数据:规模和质量是门槛

信通院联合发布的《具身智能训练场研究报告(2026年)》指出:具身基础模型要迎来“ChatGPT”时刻至少需要千万小时级真实数据,而当前全球可用的高质量真实数据仅为数十万至百万小时级,供需之间存在量级差距。

DM0.5构建了一个覆盖导航、抓取、全身控制三大任务、六类机器人本体的数据资产:5万小时真机高精度操作数据,覆盖100余种精细动作;10万小时Egocentric(人类第一人称视角)场景视频;以及100万平方米空间场景重建数据,三块加在一起,构成了一个可观的数据基础。

架构:让VLA从"复读机"变成"理解者"

很多VLA模型本质上是“数据集复读机”。训练时见过的场景,它能做得不错;换个没见过的场景,立刻懵掉。DM0.5在架构层面做了三件事,试图解决这个问题。

第一,上下文抽象层。 传统具身模型“走一步忘一步”,DM0.5原生支持最长60秒的长时记忆。能连贯审视自己过去一分钟内做过的所有动作。

第二,具身思维链。通过11项推理任务,驱动模型对“指令+本体+环境”进行三方联合建模。其中反事实任务的设置尤其关键,这种训练方式迫使模型跳出“背诵模式”,进入“理解模式”。

第三,轨迹对齐层。DM0.5用约束动态规划算法,把监督从“逐点对齐”改成了“轨迹对齐”。

图片

效率:推理速度是商业化的生死线

如果模型推理延迟是500毫秒,机器人在每个动作前都要“愣神”半秒,这在物流分拣、精密装配等场景中是不可接受的。

通过联合优化Vision TensorRT、Tuned FlexAttention、FP8精度等一系列工程手段,DM0.5将核心推理延迟从534毫秒压缩到了57毫秒,实现9.29倍加速,推理延迟降低89.2%。本质上是在改写具身智能的商业化账本,把“实验室里能跑”变成了“产线上能用”。

图片

更大的图景:

从登榜到开源基础设施

登顶RoboDojo,让原力灵机再次站到了聚光灯下。但值得关注的是一个更大的产业话题。

具身智能行业目前处于“百模大战”的混战阶段,各家模型互不兼容、数据集封闭、评测标准不统一。这种状态严重阻碍了行业从“实验室验证”走向“规模化部署”。

8月21日,在2026世界机器人大会主论坛上,开放原子开源基金会理事长、工业和信息化部人形机器人与具身智能标准化技术委员会主任委员谢少锋表示,当我们审视当前的人形机器人与具身智能产业,看到的是一幅'百花齐放'却又'各自为战'的图景”。技术路线分散、标准缺失、产业可持续发展是业界共同面对的三大挑战。

目前行业共识正在形成:没有一个企业能独立解决所有问题。开源是推动人形机器人与具身智能产业由分散探索迈向规模化、可持续发展的必经之路。

DM0.5在7月9日发布当天就宣布开源。而且原力灵机不仅开源了模型,还开源了训练框架、多个下游任务的完整工作流,甚至推出了开源硬件平台DOS-W1。从软件到硬件,从模型到工具链,原力灵机试图搭建一个完整的开发者生态。

结语

在RoboDojo仿真榜这张卷子上,DM0.5以47.74分在记忆维度断崖式领先,展现了长时记忆能力的突破;用多维能力的整体领先证明了“通用”可以被量化;用57毫秒的推理延迟把“实验室能跑”变成了“产线能用”。

但这只是一个起点。榜单的宿命就是被超越。明天可能就会有更强的模型出现,这正是具身智能技术该有的样子。

真正的考验不在榜单上,而在物流仓库、工厂装配线、家居环境里。以DM0.5为代表的挑战者已经迈出了第一步。

END

本文为「智能进化论」原创作品,

欢迎关注。

Logo

电影级数字人,免显卡端渲染SDK,十行代码即可调用,工业级demo免费开源下载!

更多推荐