很抱歉,当前没有启用javascript,网站无法正常访问。请开启以便继续访问。
媒体矩阵
创投日报
财联社 AI daily
科创日报
新消费日报
创业服务PE/VC服务城市服务未上市公司路演笔记
模型跑得快、评测跟不上?具身智能“本领”亟待统一“标尺”
原创
人工智能
科创板日报记者 李佳怡
2026-08-18 18:23
①多方共建的常态化具身智能仿真评测平台RoboColiseum正式上线,试图为具身模型建立一套结果可信、过程可复现、且与真机表现高度一致的仿真评测体系。
②今年以来,多方力量正在加速规范具身智能评测标准,但距离形成像大模型领域MMLU、GSM8K那样的统一基准,仍有很长的路要走。

《科创板日报》8月18日讯(记者 李佳怡)2026年过半,具身智能模型正在快速涌现。但模型数量的增长并未让行业变得更清晰,恰恰相反,可选方案越多,横向能力对标反而越缺乏统一参照。

过去一年,国内外多家机构陆续发布了具身基座模型和VLA(视觉-语言-动作模型),演示视频中的抓取、放置、倒水、叠衣等操作愈加“丝滑”。

然而,当前具身智能行业始终面临一个现实困境:模型跑得快,评测跟不上。模型的真实能力边界在哪、短板集中在何处,全行业仍缺少一套系统、可信的衡量标尺。

《科创板日报》记者获悉,日前,高校、科研机构、开源社区、机器人企业和模型公司多方共建的常态化具身智能仿真评测平台RoboColiseum正式上线,试图为具身模型建立一套结果可信、过程可复现、且与真机表现高度一致的仿真评测体系。

RoboColiseum项目负责人吴墨在接受《科创板日报》记者采访时披露了两项核心验证数据:平台仿真评测与实机部署的相关性达到89.5%,相同模型在仿真环境与真实世界中的评测差异小于10%。

这一结论并非凭空而来,吴墨介绍,团队基于十几个从简单到复杂的评测任务,每个任务均在真机和仿真环境中各进行了50到100次对照实验,最后通过线性拟合得出89.5%这一相关性。

RoboColiseum平台 Sim2Real实验对比

与传统评测以单一综合成功率概括模型能力的方式不同,RoboColiseum围绕不同能力维度设置多个任务集,考察模型在各个维度中的表现。据了解,RoboColiseum已上线指令跟随、空间理解、扰动适应、通用操作4类能力子榜,以及78个高保真仿真评测任务、覆盖3000 多个泛化的case。

“我们是基于考察机器人在真实世界中完成一系列任务,需要具备哪些不同维度的能力,最终总结出的4类能力子榜。”吴墨向记者解释了这一设计逻辑,“这个评测维度会去考验模型能否听懂指令、能否理解空间世界、能否去抵抗真实世界的扰动,最后完成指令操作的相关任务。”

与此同时,平台还对每项任务做了子步骤拆解,实现失败原因可追溯。评测过程中,系统不仅判定任务最终成败,还会全程记录模型完成的步骤、失败节点,以及在不同场景下的泛化表现。

自内测以来,RoboColiseum已有海内外40多支队伍在平台开展模型训练与评测。吴墨透露,泛化性、长程精细操作等是目前多数模型的短板,后续将补充相关评测维度更新至平台。

事实上,试图补上评测标准短板的并非只有 RoboColiseum。事实上,今年以来,从官方机构到企业,再到学术社区,多方力量正在加速规范具身智能评测标准。

2026年6月1日,由工业和信息化部批准发布的《YD/T 6770-2026 人工智能 关键基础技术 具身智能基准测试方法》正式实施,为具身智能领域首份行业标准。据介绍,该标准规范了在仿真环境和真实环境下,开展具身智能基准测试的环境设置、任务库构建、测试过程和指标计算方法。

在行业标准落地的同时,多家企业也推出了评测平台。光轮智能在北京人工智能创新高地建设推进会上正式发布RoboFinals,基于100项高难度任务构建标准化评测体系;Dexmal原力灵机与Hugging Face共同发起开放式基准测试平台RoboChallenge,平台累计执行的真机测试总量已突破4万次。

国际上,加州大学伯克利分校、斯坦福大学、英伟达等机构联合发起国际公开性具身智能机器人策略评测平台。该平台采用分布式、众包的真实世界评估网络,通过超过600次双盲真实机器人评估对比验证方法有效性。

尽管各方力量加速入局,但具身智能评测领域距离形成像大模型领域MMLU、GSM8K那样的统一基准,仍有很长的路要走。

具身评测为何如此之难?本质差异在于评测对象的属性不同。大模型的评测以静态的问答数据集为主,跑一遍就能对比得分。但具身模型的评测需在动态的物理世界中进行,难以压缩成一组标准问答。真机测试虽是最可靠的方式,但成本极高,一台人形机器人动辄几十万,还需配套测试场地、运维工程师与长期调试周期等。

此外,仿真评测最大的痛点还在于Sim2Real gap(仿真到现实鸿沟)。光照变化、物体位置偏移、材质差异等现实因素,都可能让一个在仿真测试中表现良好的模型,在实际部署时出现“水土不服”。

吴墨同样指出,具身行业对模型还没有一个统一的、权威的评测榜单。主要由于行业和模型发展太快,大部分评测基准推出后不再更新,无法跟上模型迭代的节奏;同时,仿真与真机之间的gap如果过大,评测结果也难以真实反映模型表现。

具身智能正处于从实验室演示迈向规模化落地的关键节点,评测体系作为产业发展的核心基础设施,重要性正日益凸显。从官方标准落地到多方平台相继入场,行业正在共识形成的路上加速探索,《科创板日报》将持续关注。

934特别声明:文章内容仅供参考,不构成投资建议。投资者据此操作风险自担。
合作伙伴
科创板日报 ©2019-2026上海界面财联社科技股份有限公司 版权所有沪ICP备14040942号-11沪公网安备31010402006048号
举报电话:021-54679377转617举报邮箱:jinran@cls.cn