具身智能这两年最常被讨论的数据问题,是“数据不够”。训练场越建越多、遥操作设备越铺越广、企业不断公布几十万小时甚至百万小时的数据目标。
但如果只把问题理解成“采得还不够多”,会漏掉更重要的一层:这些数据是谁的、质量怎么证明、能不能授权别人使用、跨公司之后责任怎么界定、最后能不能成为真正可交易的生产要素。
到2026年9月,这一层基础设施开始出现比较清晰的轮廓。
这不是一条普通的“数据政策新闻”。把过去两个多月的几个节点连起来,会看到具身智能的数据竞争正在从“采集规模”走向“资产化与流通能力”。
一、7月1日:全国统一的数据产权登记规则落地
2026年7月1日,国家数据局印发《数据产权登记工作指引(试行)》。它做的一件关键事情,是把此前分散的登记实践往统一规则上收:登记对象、登记类型、登记流程、审查标准、登记效力和登记系统,开始有了全国层面的操作框架。
两个月后回看,这一步的重要性更清楚。
机器人数据天然比普通表格数据复杂。一次“抓取杯子”的数据,不只是几帧图像,往往还包含相机、力传感器、关节状态、动作轨迹、环境参数,甚至和具体本体、末端执行器、任务定义绑定。数据能不能被另一个模型、另一台机器人、另一个场景使用,本身就需要大量说明。
所以具身智能要形成真正的数据市场,第一步不是挂牌交易,而是先把“谁拥有什么权利、数据从哪里来、允许怎么用”说明白。
需要强调的是,数据产权登记并不等于传统物权意义上的“给数据发所有权证”。它更像是一套登记与证明机制,用来明确权利边界、降低交易双方的信息成本。
二、7月23日前后:具身交互数据开始出现具体登记样本
7月下旬,深圳公开了一个很值得进入时间线的案例。
帕西尼感知科技自主研发的“元动作—倾倒”数据集完成数据知识产权登记。这套数据围绕机器人最基础的倾倒动作,记录物体属性、环境变量、交互逻辑和完整动作轨迹。
这件事看起来很细,但它恰恰说明数据资产化不会从一个“万能大数据包”开始,而可能先从一个个可描述、可复用、边界清晰的动作单元开始。
过去,机器人公司采到的数据通常只沉淀在自己的训练流水线里。完成登记以后,至少在制度上开始具备进一步授权许可、场景合作和合规流通的基础。
这里也必须区分两个概念:帕西尼完成的是数据知识产权登记,而9月上线的是全国统一的数据产权登记制度。两者不是同一张证,也不能混写。但从产业演进上,它们指向了同一个问题:具身智能数据正在从“内部资源”变成需要被正式管理的生产要素。
三、9月11日:全国数据产权登记系统真正开始运行
9月11日,国家数据产权登记服务系统上线试运行。北京国际大数据交易所、上海数据交易所、深圳数据交易所首批进入全国登记机构目录。
这意味着7月的规则开始有了真正承载它的全国基础设施。
系统上线首日,共有56份数据产权登记凭证对外公示。上海随后披露,首批15份登记凭证涉及14家主体,覆盖的领域里已经明确出现了具身智能。
这个细节比“首批56份”本身更值得机器人行业关注。
它说明具身智能不是等数据制度完全成熟以后再进入,而是在全国统一登记体系刚开始运行时,就已经成为实际登记需求的一部分。
不过现在还不能把它写成“具身智能数据交易市场已经形成”。公开材料并没有披露15份上海凭证中到底有多少份属于具身智能,也没有公布具体成交额。
所以这个节点的准确表述应该是:
具身智能数据正式进入全国统一数据产权登记基础设施的覆盖范围。
四、同一天:行业开始补“登记之后怎么办”
也是在9月11日,2026年服贸会期间,北京国际大数据交易所、东方湖景和北京港京产业科技共同成立了具身智能数据资产创新联合实验室。
三方公布的合作方向非常具体:高质量数据集建设、数据质量评价、数据产权登记、数据资产登记和交易服务。
这比再建一个“数据采集基地”更值得关注。
因为它开始回答数据市场真正难的那部分:
- 采出来的数据质量怎么比较;
- 哪些字段决定它适不适合某类模型;
- 权利材料怎么整理;
- 授权边界怎么写清楚;
- 企业怎么把数据从资源变成可被采购的数据产品;
- 数据进入资产管理和交易之后,价值怎么持续验证。
过去一年,行业最容易卷的是采集工位数量和“小时数”。但如果两个数据集都号称10万小时,一个任务分布混乱、标注缺失、权利边界不清,另一个有完整任务定义、质量评价、来源记录和授权规则,它们对模型团队的价值完全不同。
下一阶段的数据竞争,可能首先是“可用数据”与“不可直接用数据”的分化。
五、这条时间线真正改变了什么
把7月1日、7月23日和9月11日放在一起,2026年的变化就比较清楚了:
第一阶段,行业解决的是“有没有数据”。于是大量训练场、采集工厂、遥操作方案出现。
第二阶段,问题变成“数据好不好”。于是开始强调高质量数据、任务覆盖、传感器同步、清洗和质量评价。
现在第三个问题正在浮出来:这批数据能不能脱离原来的采集项目,被另一个主体放心地使用。
只有到了这一层,数据才有可能形成真正的产业分工。
数据采集公司不一定只能接外包项目,它可能运营标准化数据产品;机器人企业不一定每个任务都从零采集,它可能购买或授权已有数据;模型公司也不一定必须拥有所有采集设备,而是可以围绕数据市场做组合、验证和训练。
这和云计算早期很像:真正让算力成为基础设施的,不只是机器更多,而是资源能够被计量、调用、定价和交易。
具身数据现在正在补同样的一层。
六、但现在还远没有走到“数据商品化完成”
这个阶段最容易出现的误判,是看到“产权登记”“数据资产”几个词,就直接认为一套成熟市场已经形成。
还没有。
登记解决的是权利和信息表达的一部分问题,质量评价解决的是“好不好用”的一部分问题,真正的市场还要继续验证买方是否愿意持续付钱。
聚身之家接下来会重点追踪五个指标:
- 具身智能数据产权登记数量:从“进入首批覆盖领域”走到真正形成规模;
- 真实授权与交易:不是挂牌多少,而是有多少模型和机器人公司真正购买使用;
- 复购率:一家公司买过一次之后,会不会持续买新的任务数据;
- 跨本体复用能力:同一套数据能否服务不同机器人、不同模型,而不是绑定单一设备;
- 跨境流通:随着具身智能企业全球化,物理交互数据如何在合规框架下跨境授权和交易。
这些数字如果开始连续出现,才意味着具身数据真正从“成本中心”变成了一个产业。
七、为什么这个节点值得进入历史时间线
几年以后回看2026年,人们未必会记住首批登记凭证到底是56份还是多少份。
真正重要的变化可能是:机器人产生和使用的数据,第一次开始拥有一套越来越完整的权利表达、质量评价和流通基础设施。
具身智能过去讨论的是本体、模型、算力和数据采集。现在数据本身正在长出另一层结构:产权、授权、评价、交易。
这意味着未来一家机器人公司的核心资产,也许不只是一台机器人、一套模型和一条生产线,还包括它在真实世界中持续积累、能够被合法复用和流通的数据。
如果这一套基础设施继续成熟,具身智能产业会出现一个新的分工层:
有人造机器人,有人造模型,也会有人持续生产和运营“机器人学习世界的原材料”。
这才是9月这几件事值得被放进时间线的原因。
