“人均第一”,具身智能榜单能信吗?

2026年07月22日 11:33
本文共计6281个字,预计阅读时长21分钟。
来源/具身研习社 责编/huazi56 爱力方

具身智能赛道持续吸引资本目光的同时,各类相关榜单的数量也会越来越多。当“第一”几乎成为各家标配时,榜单是否还具备可信度呢?

一个多月前,千寻智能就已经经历了起伏时刻。6月初,其具身基座模型Spirit v1.6在RoboArena榜单上以1918分的成绩成功超过了英伟达Cosmos3的1880分,因此一度位居“世界第一”;紧接着,千寻宣布完成15亿元A+轮融资,三个月内累计完成四轮密集融资,总额接近50亿元,创下具身智能赛道的融资频率新高。

不过,业内对于评测数据的质疑几乎从次日就开始升温。有观察者指出,在310次评测记录中,有72%的分数其实来自两个账号。更值得关注的是,RoboArena官方随后发布声明,经回溯调查后发现Spirit v1.6没有出现在最新的official榜单之中,而在All Policies综合榜单口径下它依旧是第一名。

然而这一事件并未浇灭玩家们的热情,借助对近半年行业新闻的翻阅可以看到,星动纪元、原力灵机、极佳视界、智元、跨维、鹿明……几乎每一家头部公司手里都拥有一个“第一”,且这些“第一”的维度各不相同。

这一景象或许并不难以理解,因为具身智能目前的技术路线尚未实现统一,真机成功率大多维持在五六成的水平,所以外界对一家公司到底行不行开展判断时,在很大程度上只能依赖于榜单。可当发布榜单的既有高校以及机构也有媒体参与其中,各家所采用的标准各不相同、有的还牵扯到商单以及利益关系时,榜单本身是否还能够充当尺子来使用,就成了一个问题。

一位关注具身智能赛道的投资人坦率表示,榜单其实更多地偏向市场行为方面,最多只能作为投资决策过程中的一个参考依据,他对于千寻的这一事件并不感到吃惊。在他看来,那些真正在意名次的情况,往往不是以财务或技术作为出发点的机构,而是一些地方引导基金或偏向国资的资金,一个“第一”可能正是他们写在报告里面的一个比较好的入口。但也有投资人持有不同看法,他们认为在技术门槛较高、信息不对称的早期赛道当中,榜单至少可以提供一个横向比较的起点。

当“第一”的数量比认真做机器人的公司还多时,这些榜单到底是在对技术进行测评,还是在对讲故事的能力进行检验?哪些榜单还值得进行参考?

01.技术路线目前尚未实现统一,因此各方先行一步人手掌握了一个“第一”。

我们首先对目前市面上的榜单进行一次梳理,从而建立起一个大致印象。根据不完全统计,目前具身智能领域的活跃榜单数量已高达20余个。依据评测内容的不同,这些榜单大致可以分成三类。

VLA操作综合榜会对机器人是否能够真正完成实际工作任务开展考察,其中所运行的评测指标是任务成功率,代表性的榜单包括RoboChallenge Table30以及MolmoSpaces。

世界模型榜会对模型能否在脑内进行准确推演开展考察,其中主要检验模型对物理世界的推演能力,而不会考察机器人手脚是否利索,代表性的榜单包括World Arena以及WorldModelBench。

c9cfa29e5dca367c758cce0ba5fc8f2e.png

专项基准榜会对极端情况下模型会不会露馅这一问题开展考察,它主要针对单点极端能力进行检验,比如双臂协同以及仿真到真机迁移等方面,代表性的榜单包括RoboTwin 2.0、SimplerEnv、LIBERO以及CALVIN。它的价值在于,在综合榜单照不到的极端场景之中,将模型的短板充分揭示出来。

需要说明的是,这三类榜单各自具有不同侧重,因而彼此互不替代。真机榜单对执行能力开展测评,世界模型榜单对推演能力开展测评,专项榜单对边界能力开展测评,所以没有任何一个能够覆盖具身智能的全部能力。

借助这一坐标体系,近半年具身基座模型的战报就能够实现对号入座。如果对近两个月具身基座模型的战报进行汇总,就可以得到一份相当壮观的名单。

今年5月,星动纪元Era0宣称其成功拿下了RoboChallenge Table30的第一名;智元GE-Sim 2.0则在World Arena Track1方面取得了第一;跨维DSCFuncWorld则在World Arena Track2方面获得了第一。进入6月,千寻Spirit v1.6成功拿下了RoboArena的第一名,鹿明Prime R0则登顶了MolmoSpaces。几乎每一家公司都成了第一,而且它们都有具体的榜单排名作为背书。

而乱象,也是从各种榜单开始的。

最为显著的现象是,榜单首位如同流水席一般频繁更替,“第一名”的所属更换得十分迅速。RoboChallenge Table30的榜首,在过去半年里至少经历了四次更替:先是千寻Spirit v1.5以50.33%的成功率对纪录开展了刷新,随后很快又被极佳视界GigaBrain-0.1、美国波士顿动力Atlas、星动纪元Era0依次实现了超越。

这一速度,比大语言模型的主流榜单更新要快得多。2023年到2025年,GPT-4、Claude 3以及Gemini 1.5在MMLU、GSM8K等榜单上所占据的榜首位置,通常能够维持数月甚至一年的时间,即便是在2020年到2022年的高速迭代期,GPT-3以及PaLM也是以月作为换榜周期。“当下的具身智能,单个模型能霸榜一周就算不容易。”一家头部具身智能公司的从业者米范这样表示。

其将主要原因归结为两点。一是物理世界的随机性,同一个模型在真机上运行两次,成功率差三到五个百分点的情况很正常,因为光照、物体位置、机械臂公差等因素均会对结果产生影响,而MMLU这类大语言模型榜单运用固定题目以及确定性判分,同一模型运行一百次分数几乎不会改变。二是测试任务的公开程度,像RoboChallenge的Table30,30项任务分布是公开的,各家可以照着任务专门采集数据、开展模型微调后再提交,榜首的“保质期”于是被压到了以周计。

更加令人感到迷惑的是,在同一个榜单之中会同时出现好几个“第一”。

World Arena就是一个典型案例,智元GE-Sim 2.0以及跨维DSCFuncWorld在对外宣传时都称自己成功登顶了World Arena,然而实际情况是,这个榜单所包含的多条赛道当中,智元GE-Sim 2.0在Track1(感知与动作响应方面)以68.26分排在第一,跨维DSCFuncWorld在Track2(数据引擎方面)排在第一。“第一”其实分属于不同的子榜单,对外却被统一写成了同一句话。对于不熟悉赛道划分的读者来说,两家并列的“World Arena第一”的说法几乎无法分辨,甚至会让人怀疑是不是有人在撒谎,但其实谁都没说错,只是不够精确。

还有一层更为模糊的地带在于,榜单的性质呈现出混杂的状态,“第一”的含金量却被默认认定为同一档次,这就容易造成误导。

一些公司的对外口径里,经常会同时列出“某模型在RoboChallenge排名第一”,以及“在某具身智能媒体的测评中也位居第一”。前者指的是借助7×24小时真机运行所得出的成功率,后者则可能只是编辑部闭门开展讨论、甚至借助商务合作敲定的名单,两者被并排放进一句话当中,含金量却被默认成了同一档。

其中最为模糊的便是“产业榜”,有些榜单虽然顶着“产业”二字,但它们既不是以真机锁定的硬榜,也不是学术机构所背书的benchmark,而是由咨询公司或媒体合办的打分榜。类似的情况也曾经在大语言模型圈出现过,但随着学术榜、商业测评以及媒体榜逐渐实现了分层,“双料第一”才慢慢被拆掉,而具身智能目前正处于那个尚未分层的阶段。

三种现象相互叠加之后,结果便是榜单“第一”出现了严重的通货膨胀。而且这种通胀并不仅仅停留在营销层面,一个“第一”的头衔往往能够换来关注度、资源以及实打实的估值溢价。

02.一个“第一”是怎么造出来的?

既然榜单所具备的能力能够撬动真金白银,那么如何将第一名次制造出来的具体路径,也就逐步形成了行业内部默认的“潜规则”。据业内人士介绍,虽然千寻Spirit v1.6属于一种极端个例,但行业里制造“第一”的现象其实并不少见,其所采用的手法大致可以分为三种。

其中成本最低并且也最为普遍的一种方式在于借助话术包装,将“单科第一”转变为“总分第一”,其核心在于省掉那些关键的限定词。

例如,实际所取得的是“RoboTwin 2.0双臂协同VLA类Clean档第一”的成绩,但在对外宣传之时却转变为“登顶RoboTwin 2.0”;实际所获得的是“LIBERO-Plus场景泛化专项第一”,却对外表述成了“LIBERO-Plus榜首”。虽然数据并未进行造假并且成绩也确实属实,但是“第一”所指代的实际范围却被人为地进行了放大。

第二种方式是运用“刷题”等手段来对结果进行直接干预。

一条是“照着考题练”。榜单所公开的任务分布、评分标准以及环境参数,都可以用来进行定向的后训练工作,在一些任务相对固定的榜上尤其明显,各家公司可以借助反复“刷题”、过拟合到特定场景的方式来换来高分。

米范表示,在具身领域当中部分榜单的测试任务是公开的,因此各家可以针对这些任务来专门采集数据、开展模型的微调工作后再提交,这在具身圈会被视为正常的迭代行为,并不算作弊,它与LLM领域中的“数据泄露、数据污染”存在本质上的区别。

另一条则是借助钻取评测机制所存在的漏洞来达成目的。有些榜单虽然权威性很高,其机制却存在着可以利用的空子。例如RoboArena运用开放注册以及分布式评测,本意是为了让更多的人参与进来,却留下了三个空子。

图源 / RoboArena 官网

53fe399b05ca8d9952d7355a1d2ac7e1.png

一是评测者的身份并不设置任何门槛。因此任何个体均能够注册账号来担任裁判的角色,如果在短期之内有大量新注册账号集中针对同一个模型开展评测工作,那么它的Elo分数就会被快速推高;

第二点在于匹配机制并不强制要求实现全覆盖,随机分配对手的方式并不等同于必须与同期上榜的所有模型都进行一轮对战。当评测者领取任务的时候,A模型是固定不变的,而B模型则是从分数相近的模型当中随机抽取,如果样本数量不够大的话,那么两个模型完全有可能一次都无法相互匹配上。比如Spirit v1.6早期与DreamZero开展了交手,在23场之后便停止对战,同时与5月30日入榜的英伟达Cosmos3-Nano-Policy之间为零对战记录;

三是集中刷评,运用多个账号对自家模型开展密集评测,从而将负面记录予以降低。比如Spirit v1.6的310次评测记录中,72%的分数来自于ECUST以及Robotics Lab这两个账号,它们借助224场评测刷出了97%胜率,进而把Spirit v1.6推上第一,但英伟达运用同样条件自测21次,胜率却为0%,当两组数据摆放在一起时,直接让从业者产生了怀疑。

事后,RoboArena对规则开展了补充,要求评测者必须是无利益关联的第三方,从而堵住了自刷账号的入口,并将评测完成率低于20%的账号标为可疑,以此堵住了选择性匹配。而在完成处理之后,千寻跌出了榜单。

还有一种方式在隐蔽性方面最高同时泛滥程度也最大,那就是运用资源置换的方法,把榜单直接转变为了一门生意。

不少媒体榜单的评选标准往往并不透明,其中有的甚至与被评对象之间存在着商务合作,双方借助联合发布一份“权威报告”的方式,把媒体榜以及学术benchmark并排包装起来。它并不涉及技术内容,也不涉及数据支撑,而仅仅涉及预算以及关系等方面。不止一位从业者表示,刷榜、买榜等现象其实并不少见。

这三种手法往往会相互叠加,首先借助针对性训练或者钻取评测空子的方式把分数提升上去,其次运用赛道偷换来掩盖其真实来源,最后借助话术向外界开展传播,必要时还会购买媒体榜单提供背书。在层层包装之下,“第一”就此形成。

这些手法在行业内部并不是秘密。真正的问题在于,看穿它们需要具备一定的技术功底,其中技术越复杂,外行就越难以进行分辨,因此故事也就越容易被讲述出来。

03.去掉水分,还该信什么?

不止一位具身智能从业者坦言,他们当下已经不太关注榜单排名了,因为榜单既可以刷也可以买,即便一切合规,物理环境所具有的复杂性也会让数据很难做到百分百准确。

更深一层的问题在于,这个行业目前还没有构建起一把通用的尺子来对技术开展衡量。

具身智能从业者gashero借助“炒鸡蛋”和“拌凉菜”这两个例子打了一个比方:机器人A擅长完成炒鸡蛋的任务,成功率可以达到90%,机器人B则擅长拌凉菜的任务,成功率达到了85%,但是不能就此得出结论说A比B更为强大。炒鸡蛋的任务所考验的是抓取和翻锅的能力,拌凉菜的任务则考验精准倒料以及搅拌的能力,这两项任务的技能要求不同、难度系数不同、所使用的评价标准也存在差异。当下的具身智能赛道还没有建立起一个统一的评测标准,可以把“炒鸡蛋的能力”和“拌凉菜的能力”折算进入同一个打分体系里面。

不过,这并不代表榜单就完全一无是处。从业者普遍认为,榜单仍然具备其参考价值,关键在于清楚知道什么值得去看,以及看完之后还应当关注什么。

图源 / RoboChallenge官网

cf30657904c8d9b1624dd5d6fcf06d80.png

综合业内所形成的共识来判断,那些真正可信的榜单大体上会同时具备三个核心特征。

一是分项透明,不是只甩一个“第一”。

不论综合榜还是专项榜,可信的做法都是将细项一一进行拆开。以RoboChallenge Table30为例,它所测的是30项日常任务的综合成功率,可信之处在于,不仅告诉读者64.33%这个综合数字,还让读者看到30项里哪几项做得好、哪几项掉链子。只报总分、不报细项的榜,价值要大打折扣。

二是评测工作由第三方来进行掌控,而且还配备了反刷题的设计机制。

MolmoSpaces不允许模型开展微调工作,因此模型只能直接进行“裸考”;LIBERO-Plus则添加了光照突变、背景杂乱以及相机角度变化等极端扰动,其目的专门为了防止依靠死记硬背来拿分。它们的共同特点在于让刷题变得更难,从而让泛化成为真正的门槛。

三是应当对评测机制开展考察,而不是将重点放在更新频率之上。

更新速度缓慢的榜单并不一定就能被认定为可靠,而更新速度较快的榜单也并不一定就可以被轻易刷分。一些榜单之所以更新得比较慢,主要是因为开展真机评测所需要的成本极高,比如RoboChallenge要完成一次完整的评测周期往往需要花费数周的时间,其中对30项任务的每一项都要运行10次,从而总共进行300次真机尝试,并且需要7×24小时不间断地连续运行,这正是物理世界所施加的成本约束所导致的。而另外一些榜单更新得比较快,则主要是因为其所采用的机制设计。例如RoboArena运用了Elo评分系统来进行动态排名的操作,每天都会有新的对战数据输入进来,因此排名自然就会每天进行更新。这种更新速度本身并不是问题,其可信度则取决于机制是否足够严密,以及其中存在的漏洞是否已经被及时补上。

但是,既然圈内相关人士均已清楚地知晓这些榜单所存在的水分,那么各方为什么依然会如此拼命地对榜单开展刷取行动呢?

答案在于行业当前所处阶段。眼下这场“第一”的争夺战,本质上是资本焦虑的产物。今年是具身基座模型密集迭代的一年,早期赛道出货量、营收以及订单量均不稳定,因此只能借助榜单来顶上。融资导向的阶段没有改变,刷榜这件事便不会停止。

当行业迈入下一阶段之后,用于评判的标尺将会自然地发生切换,例如转向考察每年交付多少台设备、拥有哪些固定客户以及是否能够实现盈利。到那时候,“第一”所引发的通货膨胀现象会自然消散,而榜单也将退回到它原本应该处于的位置。

或许,那些并未忙于刷取榜单、而是专注于把机器人送进产线的公司,才是行业所真正需要的答案。

来源:人均第一,具身智能榜单能信吗? | 具身研习社

声明:本文来自具身研习社,版权归作者所有。文章内容仅代表作者独立观点,不代表爱力方立场,转载目的在于传递更多信息。如有侵权,请联系 copyright#agent.ren。
0
TAGS: []

相关图文

热门资讯