9月13日,PEC 2025 AI创新者大会暨第二届提示工程峰会在北京举办。大会由中国人工智能产业发展联盟指导,PEC China、至顶科技、软积木主办,AIGCLink、爱智岛人工智能艺术家创作联盟、LangGPT、硅创社等联合主办,数百家行业协会、研究院、社区与知名机构协办,共探“新作品时代”的AI未来图景,幂特科技联合创始人CTO 王志成受邀出席大会。

 

 

 

如何推动人形机器人持续成长、成长为未来新一代生产力,仍是一个值得整个产业思考的关键问题。

 

在9月13日的PEC 2025 AI创新者大会暨第二届提示工程峰会上的年度提问环节

 

人形机器人各个领域的专家,进行了一场以《新物种时代:人形机器人如何“长大”?》为主题的深度对话。

 

在这场深度对话中,他们从硬件、算法、数据、算力全维度,一起探讨了人形机器人的技术现状、成长空间,以及商业化路径。

 

幂特科技主要从数据层面,发表了精彩的演说。

 

01 具身智能热潮中,人形机器人的技术收敛了吗?

问:人形机器人现在对仿真数据和真实数据有怎样的需求?

 

王志成:幂特科技的英文名是PowerTech,我们希望通过自己的努力,使具身智能的数据呈指数级增长,使具身智能的智能幂次进化。

 

目前具身的数据确实非常稀缺,特别是数据多样性的稀缺是制约具身智能破局的关键。以目前数采方案来看,数据量也很难实现指数级增长。

 

仿真数据的好处是可以快速地去生成具有一定随机性的大量数据,这里的关键点不是大量,而是随机性,通过随机性可以弥补一些真机无法覆盖的场景。

 

 

 

 

但是通过仿真很难复刻整个世界,会有一定人为设计的痕迹,我觉得更多、更大量的数据需要来自于真实世界。

 

真实的数据有两个优点:

 

一个是,它可以快速在特定场景搭建数采通路,可以尽快在特定场景构建Demo;

 

另一个是,真机数据可以提供真实世界物理交互的力学信息,可以提供真实世界的触觉反馈,这两点是人形机器人在真实世界落地必不可少的。

 

问:如何低成本、获取高质量、海量数据?

 

王志成:在回答这个问题之前,我们先要回答这几个问题:

 

什么样的数据采集方案可以使得我们的数据成指数级增长?

 

什么样的数据获取方案可以不用穿戴额外设备?

 

什么样的数据获取方案可以尽可能贴近真实世界的多样性?

 

我觉得使用人类视频数据是一个比较好能回答这三个问题的方案。

 

我们是通过3D人体姿态识别和人的动作轨迹还原,可以使得视频数据真正通过重定向映射到人形机器人上,生成真正可以用来去做后训练的数据。

 

我们也关注到特斯拉最近在做技术路线的转型,更聚焦到人类视频数据上,我相信他们也有类似的思考。

 

02 现有技术储备下,人形机器人有怎么样的成长空间?

 

问:我们知道现在有一种说法是“有多少数据、就有多少智能”,您对今年就人形机器人的技能泛化性有怎样的预期?

 

 

 

王志成:我非常同意您说的“有多少数据,就有多少智能”。

如果说讲泛化性,我觉得其实得从两个方面去讲,一个是从数据,一个是从模型。

 

从数据层面来看,我们需要思考的问题是,按照目前数据获取方式都是呈线性增长趋势,如果模式不变,或者说没有一种呈指数方式获取数据的方法,我觉得到今年年底可能只是有些以前不能干的任务现在能干了,或者以前能干的任务现在干得更细了,不会有本质上的突破。

 

我们认为泛化性如果真发生本质的突破,一定是数据获取方式上有了新的质变。

 

从模型层面来看,现在比较火的VLA是从LLM或VLM演进而来,无论是LLM还是VLM,本质上都是为language设计的,它的强项在于理解。人形机器人的核心是action,从理解到动作是有很大的鸿沟的,从特征和信息维度来看,有很大的差别。

我认为,从真正适配人形机器人泛化性来入手设计模型会更有必要,这会是一个大问题,需要整个行业一起努力。

 

综上,提升人形机器人的泛化性,需要从数据和模型两个维度去做本质突破。