文章ID:8576

绣春刀

人均第一,具身智能榜单能信吗?_我的网站

大秦帝国之纵横

A |     刷题、话术包装、资源置换。    新华社客户端频道8月17日电(赵元君)现代化的企业车间内,机器手臂有序挥舞;创新实验室中,研发新品不断“出炉”;项目园区里,工程机械往来穿梭……时下,一幅经济高质量发展的生动图景正在石家庄的广袤大地上徐徐铺展。

B |          定焦One(dingjiaoone)原创          作者 | 王璐          编辑 | 魏佳          具身智能赛道持续吸引资本目光的同时,各类相关榜单也越来越多。自2021年石家庄市第十一次党代会以来,这座城市锚定生物医药、新一代电子信息、先进装备制造、现代食品、现代商贸物流五大千亿级产业集群目标,坚持做优传统产业、做强主导产业、做大新兴产业,各项事业呈现出蓬勃发展的良好态势。截至2025年底,全市五大主导产业全部迈入千亿级行列,一个让本地人自豪、外地人向往的魅力之城正加速走来。

C | 当“第一”几乎成为各家标配时,榜单还有可信度吗?          一个多月前,千寻智能就经历了尴尬时刻。

D | 产业集聚成势 矩阵轮廓成型驱车行驶在鹿泉经济技术开发区,一个个带有“电子”“通信”“光电”“集成电路”等字样的企业从眼前掠过,一派科技、现代、生态相融合的繁华景象扑面而来。6月初,其具身基座模型Spirit v1.6在RoboArena榜单上以1918分的成绩超过了英伟达Cosmos3的1880分,一度位居“世界第一”;紧接着,千寻宣布完成15亿元A+轮融资,三个月内累计完成四轮密集融资,总额接近50亿元,创下具身智能赛道的融资频率新高。

E | 在普兴电子科技股份有限公司超级净化厂房内,自主生产的外延片已广泛应用于新能源汽车、轨道交通、航天航空等领域,产量规模位居全国前列。         不过,业内对评测数据的质疑几乎从次日就开始升温。有观察者指出,在310次评测记录中,有72%的分数来自两个账号。更值得关注的是,RoboArena官方随后发布声明,经回溯调查后移除了部分存疑的评测数据,并更新了榜单排名。

↑石家庄电子信息产业园。(梁子栋 摄)数十公里外的石家庄高新区,产业集群效应同样凸显。如今,占地2.8万亩的石家庄市国际生物医药园内,已形成“研发—孵化—产业化—销售及服务”的全链条生态,成为全市生物医药产业集聚发展的重要载体。Spirit v1.6也随之从榜单上除名。2025年,全市生物医药产业营业收入突破1400亿元。         但这一事件并未浇灭玩家们的热情,翻开近半年的行业新闻,星动纪元、原力灵机、极佳视界、智元、跨维、鹿明……几乎每一家头部公司手里都攥着一个“第一”,且这些“第一”维度各不相同。5年来,石家庄市出台多项扶持措施,设立产业发展基金,按照“插花式开发为集中开发让路、土地供应优先保障产业所需”思路,连片推进、集群发展主导产业。

F | 先进装备制造产业持续向“智造”迈进,现代食品产业形成龙头企业引领、中小企业蓬勃发展的良好态势,现代商贸物流产业联通全球,连续多年保持两位数增长。一幅生动的产业矩阵图已然成型。创新破局发力 动能加速跃升不久前,石药集团与国际知名制药企业阿斯利康签署战略合作协议,将在石家庄高新区建设新一代生物制剂生产基地。凭借前沿的AI新药设计和发现平台,石药已有11项创新成果实现对外授权。         这一景象或许不难理解,具身智能目前技术路线还没统一、真机成功率大多卡在五六成,外界想判断一家公司到底行不行,很大程度上只能依赖榜单。“创新是发展的唯一出路。唯有掌握核心技术命门,才能研发出更多‘中国好药’。”石药集团润石研究院院长杨汉煜说。近年来,石家庄深入实施创新驱动发展战略,全市拥有省级及以上科技创新平台500余家,总量位居全省第一。可当发榜的既有高校、机构也有媒体,各家标准各不相同、有的还牵扯商单和利益关系时,榜单本身还能不能当尺子用,就成了一个问题。2021年以来,生物医药企业本地注册上市一类新药8个、在研一类新药83个。

G | 石家庄深化与北京大学等20余所高校合作,清华发展研究院、工业大学创新研究院等多家研究院相继落户,成为城市发展的强有力“外脑”支撑。同时,制定促进京津冀协同创新政策措施,建立省市技术转移机构47家,推动更多创新成果从“实验室”走向“生产线”。

H |

↑石家庄市国际生物医药园。         一位关注具身赛道的投资人坦言,榜单更偏市场行为,最多算投资决策的一个参考,他对于千寻这件事并不吃惊。在他看来,真正在意名次的,往往不是以财务或技术为出发点的机构,而是一些地方引导基金或偏国资的资金,一个“第一”,可能正是他们“写在报告里一个比较好的入口”。但也有投资人持不同看法,他们认为在技术门槛高、信息不对称的早期赛道,榜单至少提供了一个横向比较的起点。         当“第一”的数量比认真做机器人的公司还多时,这些榜单到底是在测技术,还是在测讲故事的能力?哪些榜单还值得看?          01.技术路线还没统一,先人手一个“第一”          我们先来盘一盘目前市面上的榜单,建立一个大致印象。(梁子栋 摄)营商环境优化 释放“磁场”效应2025年9月,位于石家庄高新区的格瑞邦()数字科技有限公司数字化智能生产线上,一台台笔记本电脑陆续下线。据不完全统计,目前具身智能的活跃榜单高达20余个。作为出口60余个国家、年销售额超10亿元的“隐形冠军”,格瑞邦为何离开深圳迁往石家庄?“这不是招商,是共同创业。按评测内容,这些榜单大致可以分成三类。”一个月深度接洽后,企业董事会全票通过北迁决议。如今,格瑞邦的入驻已吸引上下游十余家企业签约,一个计算机整机产业链破土而出。近年来,石家庄市围绕“全生命周期、全市场主体、全要素保障”目标,着力打造市场化、法治化、国际化一流营商环境。2021年9月,石家庄在全省率先探索开展“双盲”评审改革,投标“不出门”、开标“不见面”、评标“屏对屏”已成为常态,该做法入选2024年全国优化营商环境十大创新实践案例。         VLA操作综合榜,考察机器人能不能真干活,跑的是任务成功率,代表榜单是RoboChallenge Table30、MolmoSpaces;          世界模型榜,考的是脑内推演对不对,考察模型对物理世界的推演,不考机器人手脚利不利索,代表是World Arena和WorldModelBench;          专项基准榜,考察“极端情况下会不会露馅”,针对单点极端能力,比如双臂协同、仿真到真机迁移,代表是RoboTwin 2.0、SimplerEnv、LIBERO 和 CALVIN。它的价值在于,在综合榜照不到的极端场景里,把模型的短板逼出来。

I | 此外,石家庄在全省率先颁布实施《优化营商环境条例》,推行“高效办成一件事”,政务服务事项实现100%网办;打造低成本化园区,平均单个项目可节约2个月时间,累计为企业节约成本超3.8亿元。

J |          需要说明的是,这三类榜单各有侧重、互不替代。环境好起来,投资热起来,发展快起来。随着华普生物、绿叶制药、海康威视等知名企业纷纷落户,石家庄正成为近悦远来的创新策源地与发展活力区。

K | 真机榜测执行、世界模型榜测推演、专项榜测边界,没有任何一个能覆盖具身智能的全部能力。         有了这层坐标,近半年具身基座模型的战报就能对号入座。

L | 如果把近两个月具身基座模型的战报汇总,可以得到一份相当壮观的名单。         今年5月,星动纪元Era0宣称拿下RoboChallenge Table30第一;智元GE-Sim 2.0是World Arena Track1第一;跨维DSCFuncWorld是World Arena Track2第一。进入6月,千寻Spirit v1.6拿下RoboArena第一(后被除名),鹿明Prime R0登顶MolmoSpaces。几乎每一家都是第一,而且都有具体榜单排名作背书。         而乱象,也是从各种榜单开始的。

M |          最明显的是,榜首像流水席,“第一名”更换频繁。         RoboChallenge Table30的榜首,过去半年里至少换了四次:先是千寻Spirit v1.5以50.33%的成功率刷新纪录,很快又被极佳视界GigaBrain-0.1、美国波士顿动力Atlas、星动纪元Era0先后超越。         这个速度,比大语言模型的主流榜单更新快得多。2023年到2025年,GPT-4、Claude 3、Gemini 1.5在MMLU、GSM8K等榜单上的榜首位置,通常能守数月甚至一年,即便是2020年到2022年的高速迭代期,GPT-3、PaLM也是以月为换榜周期。“当下的具身智能,单个模型能霸榜一周就算不容易。”一家头部具身智能公司的从业者米范表示。         其将主要原因归结为两点。一是物理世界的随机性,同一个模型在真机上跑两次,成功率差三到五个百分点很正常,光照、物体位置、机械臂公差都会影响结果,而MMLU这类大语言模型榜单是固定题目、确定性判分,同一模型跑一百次分数几乎不变。二是测试任务的公开程度,像RoboChallenge的Table30,30项任务分布是公开的,各家可以照着任务专门采数据、微调模型再提交,榜首的“保质期”于是被压到了以周计。         更让人迷惑的,是同一个榜里会同时冒出好几个“第一”。

N |          World Arena就是典型,智元GE-Sim 2.0、跨维DSCFuncWorld对外都称自己“登顶World Arena”,但事实是,这个榜单含有多条赛道,智元GE-Sim 2.0在Track1(感知与动作响应)以68.26分排第一,跨维DSCFuncWorld在Track2(数据引擎)排第一。“第一”分属不同个子榜,对外却被统一写成了同一句话。

o |          对不熟悉赛道划分的读者来说,两家并列的“World Arena第一”的说法几乎无法分辨,甚至会怀疑是不是有人在撒谎,但其实谁都没说错,只是不够精确。

p |          还有一层更模糊的地带是,榜单性质混杂,“第一”的含金量却被默认成同一档,容易产生误导。         一些公司的对外口径里,经常会同时列出“某模型在RoboChallenge排名第一”,和“在某具身智能媒体的测评中也位居第一”。前者是7×24小时真机跑出来的成功率,后者可能只是编辑部闭门讨论、甚至商务合作敲定的名单,两者被并排放进一句话,含金量却被默认成了同一档。         其中最模糊的是“产业榜”,有些榜单顶着“产业”二字,但既不是真机锁死的硬榜,也不是学术机构背书的benchmark,而是咨询公司或媒体合办的打分榜。类似情况也在大语言模型圈出现过,但随着学术榜、商业测评、媒体榜逐渐分层,“双料第一”才慢慢被拆掉,而具身智能,眼下正处在那个尚未分层的阶段。         三种现象叠加,结果就是榜单“第一”严重通货膨胀。

q | 而且这种通胀不只停留在营销层面,一个“第一”的头衔往往能换来关注度、资源和实打实的估值溢价。         02.一个“第一”是怎么造出来的?          既然榜单能撬动真金白银,如何把第一造出来,也形成了“潜规则”。业内人士介绍,虽然千寻Spirit v1.6属于极端个例,但行业里造“第一”的现象并不少,手法大致有三种。         成本最低、也最普遍的一种方式是话术包装,“单科第一”成了“总分第一”,核心是省掉关键限定词。         比如实际拿的是“RoboTwin 2.0双臂协同VLA类Clean档第一”,对外就变成“登顶RoboTwin 2.0”;实际是“LIBERO-Plus场景泛化专项第一”,对外就成了“LIBERO-Plus榜首”。数据没造假、成绩也是真的,但“第一”所指代的范围被人为放大了。         第二种方式是利用“刷题”等方式直接干预结果。         一条是“照着考题练”。榜单公开的任务分布、评分标准、环境参数,都可以拿来做定向后训练,在一些任务相对固定的榜上尤其明显,各家可以通过反复“刷题”、过拟合到特定场景换来高分。         米范表示,具身领域的部分榜单的测试任务是公开的,各家可以针对这些任务专门采集数据、微调模型后再提交,这在具身圈被视为正常迭代,不算作弊,和LLM领域的“数据泄露、数据污染”有本质区别。

r |          另一条是钻评测机制的漏洞。有些榜权威性很高,机制却有空子可钻。比如RoboArena采用开放注册、分布式评测,本意是让更多人参与,却留下了三个空子。         图源 / RoboArena官网          一是评测者身份无门槛。任何人都能注册当裁判,短期内大量新账号集中评测同一个模型,就能把它的Elo分数快速推高;          二是匹配不强制全覆盖,随机分配对手不等于必须跟同期在榜者都打一轮,评测者领任务时,A 是固定的,B 是从分数相近的模型里随机抽,样本不够大时两个模型完全可能一次都排不上。比如Spiritv1.6早期与DreamZero交手,23场后停战,与5月30日入榜的英伟达Cosmos3-Nano-Policy为零对战;          三是集中刷评,用多个账号密集评测自家模型,把负面记录降低。比如Spirit v1.6的310次评测记录中,72%的分数来自于ECUST和Robotics Lab两个账号,它们用224场评测刷出97%胜率,把Spirit v1.6推上第一,但英伟达用同样条件自测21次,胜率0%,两组数据摆在一起,直接让从业者产生怀疑。         事后,RoboArena补了规则:评测者必须是无利益关联的第三方,堵住自刷账号的入口,评测完成率低于20%的账号标为可疑,堵住选择性匹配。而处理后,千寻跌出榜单。

s |          还有一种方式最隐蔽也最泛滥,是资源置换,把榜单直接做成生意。

t |          不少媒体榜评选标准并不透明,有的干脆与被评对象存在商务合作,双方联合发一份“权威报告”,把媒体榜和学术benchmark并排包装。它不涉及技术,也不涉及数据,只涉及预算和关系。不止一位从业者表示,刷榜、买榜等现象并不少见。         这三种手法往往叠加,先靠针对性训练或钻空子把分数刷上去,再用赛道偷换掩盖来源,最后用话术对外传播,必要时再买个媒体榜背书。层层包装之下,“第一”就成了。         这些手法在行业内部并不是秘密。真正的问题在于,看穿它们需要一定的技术功底,技术越复杂,外行越难分辨,故事就越容易讲。         03.去掉水分,还该信什么?          不止一位具身智能从业者坦言,他们当下已经不太关注榜单排名了,因为榜单能刷、能买,即便一切合规,物理环境的复杂性也让数据很难做到百分百准确。         更深一层的问题是,这个行业目前还没有一把“通用的尺子”。         具身智能从业者gashero用“炒鸡蛋”和“拌凉菜”打了一个比方:机器人A擅长炒鸡蛋、成功率90%,机器人B擅长拌凉菜、成功率85%,但不能就此说A比B强。炒鸡蛋考验抓取和翻锅,拌凉菜考验精准倒料和搅拌,两件事技能不同、难度不同、评价标准也不同。当下的具身智能赛道还没有一个统一标准,能把“炒鸡蛋的能力”和“拌凉菜的能力”折算进同一个打分体系里。

u |          不过,这不代表榜单一无是处。从业者普遍认为,榜单仍有其参考价值,关键在于知道什么值得看,以及看完之后还该看什么。         图源 / RoboChallenge官网          综合业内共识,真正可信的榜单,大体同时具备三个特征。         一是分项透明,不是只甩一个“第一”。         不论综合榜还是专项榜,可信的做法都是把细项一一拆开。以RoboChallenge Table30为例,它测的是30项日常任务的综合成功率,可信之处在于,不仅告诉读者64.33%这个综合数字,还让读者看到30项里哪几项做得好、哪几项掉链子。只报总分、不报细项的榜,价值要大打折扣。         二是评测由第三方掌控,且有反刷题设计。         MolmoSpaces不允许微调,模型直接“裸考”;LIBERO-Plus则加了光照突变、背景杂乱、相机角度变化等极端扰动,专门防止靠死记硬背拿分。它们的共同特点,是让刷题变难,让泛化成为真正的门槛。

v |          三是看评测机制,而不是看更新频率。

w |          更新慢的榜单不一定可靠,更新快的榜单也不一定可刷。

x | 有些榜更新慢,可能因为真机评测成本极高,比如RoboChallenge一次完整评测周期可能要数周,30项任务每项跑10次,一共300次真机尝试,7×24小时连续运行,这是物理世界的成本约束。

y | 而有些榜更新快,则是机制设计。比如RoboArena采用了Elo评分系统进行动态排名,每天都有新对战数据进来,排名自然每天更新。这种快本身不是问题,它的可信度取决于机制是否严密、漏洞是否被补上。         但是,既然圈内都知道榜单有水分,为什么大家还在拼命刷?          答案在于行业当下的阶段。

z |          眼下这场“第一”的争夺战,本质上是资本焦虑的产物。今年是具身基座模型密集迭代的一年,早期赛道出货量、营收、订单量都不稳定,只能拿榜单顶上。融资导向的阶段没变,刷榜这件事就不会停。

|          当行业进入下一阶段,评判的标尺会自然切换,例如每年交付多少台、有哪些固定客户、是否能盈利。到那时候,“第一”的通货膨胀会自然消散,榜单也会退回它本该在的位置。         或许,那些不忙着刷榜、只顾着把机器人送进产线的公司,才是行业真正的答案。         *题图由「定焦One」拍摄。应受访者要求,文中米范为化名。

Current article:http://k7tktc.mexuanmeixuyaopinzheng.shop/news/20260826_963638.html

Published on:04:41:30


用户评论
用户名:
E-mail:
评价等级:               
评价内容: