
01 数据缺口与数据异构的鸿沟
技术市场研究机构Interact Analysis数据显示,截至 2025 年年底,中国已经有50个以上国家或省市区级人形机器人数据采集与训练中心处于使用或规划建设状态,其中,50% 以上的数采中心已经在2025 年正式投入使用。
以北京人形机器人数据训练中心为参照,其真机数据的年产能已达千万条级别。以此粗略计算,假设目前所有数据中心全部投入运行,机器人数据年采集量可以达到数十亿条。
这看似庞大的数据供给,在机器人所需要的“智能”面前,仍显得杯水车薪。
据机器人数据服务商幂特科技保守测算,在具身智能大模型足够好且数据质量足够高的前提下,训练机器人学会一个动作,大概需要1000-5000条数据;训练机器人学会一个由多个动作组成的任务,大概需要1万-2万条数据;训练机器人完成某个垂直行业80%的人类工作,至少需要1亿条数据;如果要把具身智能要放大到通用,也就是千行百业,那所需的数据量至少是千亿条的量级,数据缺口是4-5个数量级。

北京人形机器人数据训练中心视觉动作捕捉项目
更大的鸿沟在于数据异构。因为不同厂商、不同形态的机器人在硬件设计、传感器配置和软件协议上各不相同,采集到的动作、力觉与视觉数据也就“语言不通”,基于一种机器人的数据成果,换到另一台机器人上就可能失灵。
这意味着,各个数据中心训练的数据成果,甚至很难实现1+1=2的叠加效果。
在行业通用的统一标准出现之前,数据中心也在探索各种不同的解决思路。
一种是“屏蔽差异”,采用市占率较高的机械臂或机器人型号进行数据训练,从硬件根源上规避了兼容性问题,以追求数据的更广泛应用,比如上文提到的北京人形机器人数据训练中心。
另一种思路是“拥抱差异”,主动进行异构训练。在上海张江,国家地方共建人形机器人创新中心(以下简称“国地中心”)具身智能训练场,首创异构人形机器人具身智能数据集构建方法,其目标是要打造最大规模的异构人形机器人具身智能数据集。
在这里,来自不同厂家的机器人被置于同一物理空间内协同运行。国地中心首席科学家江磊在接受媒体采访时曾表示,“把不同厂家的异构机器人放在同一空间运行,就能让AI意识到,它活在一个多元多样的物理世界中,从而建立起客观认知,发育出明辨是非的能力。”
第三条技术路径,是直接“绕过差异”,寻找更广泛和通用的数据。与关节传感器等硬件采集的数据不同,人类视频数据对机器人来说是相对通用的,可以提取视频数据中人体的位姿并映射为机器人的运动轨迹,绕开本体壁垒训练大模型。
更激进的方案是直接抛开本体,进入仿真世界。在虚拟的数字化环境中,通过物理引擎和程序模拟,可以低成本地生成海量数据,再应用到真机上,实现Sim2Real。然而,物理世界的极端复杂性,从根本上决定了,仿真数据在精准性与泛化性上,难以达到理想水平。
“我们希望能在真实与仿真之间找到一种平衡,兼具两者的好处。”幂特科技CEO介绍了其Real2Sim2Real的数据采集模式:在虚拟环境前面增加“Human Doing Video”作为机器人学习的标本和范式,“我们将来自真实世界的人类操作的2D视频数据做3D重建,通过仿真还原人体的3D位姿,并将3D位姿retargeting到机器人,所以我们叫Real2Sim2Real。”
据介绍,使用这一方式,幂特科技的目标是把单条数据的成本从现在真机数据的几十元降到几分钱,并快速将廉价的采集设备分发到千行百业,获得海量数据。

声明:我们重在分享,同时尊重原创,如有侵权,请及时联系,我们会在24小时内删除!