下载超2000万次!北京人形加速打造“数据超级工厂”
北京日报客户端 | 记者 赵语涵

2026-09-02 16:03 语音播报

热点

机器人想要认识世界、理解世界,就需要大量来自物理世界的数据“教材”。如今,北京正在加速打造面向全球的具身智能“数据超级工厂”。9月2日,北京人形机器人创新中心宣布,其开源数据集RoboMIND全球下载量突破2000万次,短短一个月下载量实现翻倍的背后,是我国人形机器人开源数据生态获得全球研发群体的广泛认可。

采集人员进行机器人动作数据采集。北京人形供图

走进北京人形具身智能机器人数据与训练基地,近6000平方米的实训空间,一派忙碌的采集景象映入眼帘。家居、商超、工业装配、仓储物流、医疗辅助、特种作业等四十余个模拟实景分区排布,数据采集员穿戴采集设备,在不同模拟场景中反复完成抓取物件、开关设备、分拣零件、整理物料、姿态调整等各类实操动作。除了搭建的模拟实景,在动作捕捉区域,动捕人员穿着特定装备完成高难度动作,头顶光学捕捉摄像头,把动作细节完整记录。每天,这些采集下来的高质量数据会源源不断汇入数据平台,经过多轮清洗、标注、校验、质检,最终形成标准化样本,用于算法模型训练,帮助机器人不断认识、理解世界。

自2025年12月开源以来,RoboMIND已累计释放30万余条双臂操作轨迹,覆盖700余项实操任务,面向全球开发者全量开放。整个数据基地建成不到一年,部署了40种构型共计150余台机器人设备,搭建起多机型协同采集体系,年数据产能可达18万小时,已经对外交付近3万小时高质量数据,七成以上产能服务行业客户。

目前,数据基地已经搭建起覆盖家庭生活、工业生产、商业服务等多领域的场景矩阵,并持续扩充任务库与动作样本库,长远目标瞄准产出100万小时高质量人形机器人交互数据。同时,基地深度参与多项国家、行业标准编制,搭建起从数据采集、标注、评测到交付的标准化体系,为整个行业输出统一的数据规范。在不久前的世界人形机器人运动会赛场,依托基地产出的海量训练数据,天工机器人跑出百米8.64秒的好成绩,拿下多项赛事冠军。

伴随具身智能产业浪潮兴起,高质量数据已成为具身智能迭代进化的核心燃料。不同于语言大模型主要学习文本语义,人形机器人需要深度理解纷繁复杂的真实物理世界,物体软硬程度、表面摩擦力、空间距离、环境光照变化、突发障碍物等大量动态变量,无法全部依靠人工编写代码预设。此前很长一段时间里,国内人形机器人赛道面临高质量具身数据稀缺、各家数据格式不统一、数据生态碎片化等难题,不少企业需要投入高额成本自建采集体系,研发门槛居高不下。RoboMIND下载量突破2000万次,正是整个行业对于标准化、可复用开源数据资源强烈需求的直观印证。

这份来自北京的开源数据成果,对国内人形机器人产业发展有着深远意义。数据集面向全球开放共享,打破行业的数据壁垒,有效降低中小机器人企业、高校科研团队的研发门槛,避免头部企业形成技术垄断,凝聚产学研协同创新合力。不止于产出数据集本身,依托北京人形数据基地的持续建设,北京正在系统性夯实人形机器人产业底层数据基座,逐步打通采集、标注、训练、评测、部署、场景回流的完整数据闭环。

滚动新闻

编辑:王雯淼

打开APP阅读全文
APP内打开